
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
回过头看,磐石想做的事情其实很直白:在单张 AMD W7900(48GB)+ ROCm 7.14 上,把一个企业级私有 AI Agent 跑通——推理、嵌入、向量检索全本地,零外部 API 调用,还顺手把硬件研发最痛的"读 datasheet / 写 Verilog / 跑仿真"给包了。实测数字摆在这儿:14B FP16 ≈ 27.5 tok/s(~30GB)、7B ≈ 46 tok/s(~15G
回过头看,磐石想做的事情其实很直白:在单张 AMD W7900(48GB)+ ROCm 7.14 上,把一个企业级私有 AI Agent 跑通——推理、嵌入、向量检索全本地,零外部 API 调用,还顺手把硬件研发最痛的"读 datasheet / 写 Verilog / 跑仿真"给包了。实测数字摆在这儿:14B FP16 ≈ 27.5 tok/s(~30GB)、7B ≈ 46 tok/s(~15G
回过头看,磐石想做的事情其实很直白:在单张 AMD W7900(48GB)+ ROCm 7.14 上,把一个企业级私有 AI Agent 跑通——推理、嵌入、向量检索全本地,零外部 API 调用,还顺手把硬件研发最痛的"读 datasheet / 写 Verilog / 跑仿真"给包了。实测数字摆在这儿:14B FP16 ≈ 27.5 tok/s(~30GB)、7B ≈ 46 tok/s(~15G
在 AMD Radeon Cloud 的 ROCm 单卡环境上,用 LoRA 对 Gemma 4 做情绪分类微调。单卡 17 分钟跑完 1 轮,准确率从 0.625 提升到 0.915,Macro F1 从 0.4824 提升到 0.8645。本文记录完整调优过程与结果分析。

本文详细记录了在AMD Radeon Cloud单卡环境下,使用Qwen3-0.6B模型和LoRA方法微调明日方舟干员助手的过程。作者从环境配置(ROCm 6.x)、数据集构建(8,846条干员问答对)到模型训练(8-15分钟完成)进行了完整说明,重点展示了小模型(0.6B参数)通过LoRA高效微调(仅训练0.22%参数)实现专业化任务的能力。最终得到的助手不仅能准确回答干员属性、技能等游戏知识,

用 AMD Radeon RX 7900 XTX 单卡,以 Qwen3-4B 为底座、LoRA 做参数高效微调,训练一个《绝区零》仪玄角色助手,再通过 vLLM 部署推理,配合 ChromaDB 向量检索和防 OOC 校验器,实现风格还原 + 知识准确 + 人设稳定。本文记录从环境配置、数据集构建、LoRA 微调、vLLM 部署到踩坑填坑的全流程,AMD ROCm 生态实战可复现。

本文详细记录了在AMD Radeon Cloud单卡环境下,使用Qwen3-0.6B模型和LoRA方法微调明日方舟干员助手的过程。作者从环境配置(ROCm 6.x)、数据集构建(8,846条干员问答对)到模型训练(8-15分钟完成)进行了完整说明,重点展示了小模型(0.6B参数)通过LoRA高效微调(仅训练0.22%参数)实现专业化任务的能力。最终得到的助手不仅能准确回答干员属性、技能等游戏知识,

用 AMD Radeon RX 7900 XTX 单卡,以 Qwen3-4B 为底座、LoRA 做参数高效微调,训练一个《绝区零》仪玄角色助手,再通过 vLLM 部署推理,配合 ChromaDB 向量检索和防 OOC 校验器,实现风格还原 + 知识准确 + 人设稳定。本文记录从环境配置、数据集构建、LoRA 微调、vLLM 部署到踩坑填坑的全流程,AMD ROCm 生态实战可复现。

用纯原生 HTML/CSS/JS 零依赖打造一个绝区零风格的 AI 角色助手 WebUI,拆解 ZZZ 视觉语言(黄黑撞色、斜切角、故障艺术),实现流式对话、Markdown 渲染、RAG/校验开关交互,并通过 nginx 反代联调 vLLM 后端。本文从前端设计理念、页面结构、视觉实现到联调踩坑全流程实战。

本文介绍了在AMD开发者云平台上部署Google Gemma4-E4B-it大模型的完整流程。首先通过ROCm环境验证GPU可用性,然后使用ModelScope下载模型权重(约15G)。关键步骤包括安装适配ROCm的vLLM推理框架(需重装特定版本)、启动HTTP服务进行模型加载,并通过新终端进行对话测试。文章提供了详细命令速查表,并针对常见问题(如下载失败、显存不足等)给出解决方案。整个部署过程







