logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

AMD 云服务器实战:15 分钟完成 Gemma 4 大模型云端部署全流程

2026 年 4 月 2 日,Google DeepMind 发布了 Gemma 4 系列开源模型(Apache 2.0 协议),包含 4 个规格:E2B(20亿有效参数)、E4B(40亿)、12B Dense、26B MoE(~38亿激活参数)和 31B Dense。全系列原生支持多模态(文本+图像+视频+音频)、256K 超长上下文窗口、Function Calling,且对消费级 GPU 极

#服务器#运维
# Datawhale x AMD Hello-ROCm + Qwen2.5-3B-Instruct # 云端推理部署实战

文章摘要:作者在48GB显存的AMD GPU实例上已部署Gemma 4模型(占用32.7GB),决定利用剩余15GB显存再部署一个轻量级模型。经过对比选择Qwen2.5-3B-Instruct中文模型,尝试使用vLLM部署时遭遇ROCm兼容性问题,最终改用transformers直接加载。验证显示该方案推理速度快(430+ it/s),能满足中文场景需求,且资源占用合理(约6GB显存)。整个过程体

#服务器
# Datawhale x AMD Hello-ROCm + Qwen2.5-3B-Instruct # 云端推理部署实战

文章摘要:作者在48GB显存的AMD GPU实例上已部署Gemma 4模型(占用32.7GB),决定利用剩余15GB显存再部署一个轻量级模型。经过对比选择Qwen2.5-3B-Instruct中文模型,尝试使用vLLM部署时遭遇ROCm兼容性问题,最终改用transformers直接加载。验证显示该方案推理速度快(430+ it/s),能满足中文场景需求,且资源占用合理(约6GB显存)。整个过程体

#服务器
Datawhale × AMD Hello-ROCm 学习笔记:1小时极速体验AMD云环境模型微调

本文介绍了Datawhale与AMD联合发布的Hello-ROCm项目,这是国内首个系统性ROCm中文开源教程,覆盖环境搭建、模型部署、微调到底层优化的全流程。教程分为四个阶段,支持Qwen3和Gemma4等模型,亮点包括中文文档、AI工具集成和云端GPU环境。重点演示了在AMD云环境中的模型微调实践,使用LoRA技术将通用模型改造为情感分析专家,仅需少量参数调整即可达到85%+的准确率。实践表明

#人工智能
AMD 云服务器实战:15 分钟完成 Gemma 4 大模型云端部署全流程

2026 年 4 月 2 日,Google DeepMind 发布了 Gemma 4 系列开源模型(Apache 2.0 协议),包含 4 个规格:E2B(20亿有效参数)、E4B(40亿)、12B Dense、26B MoE(~38亿激活参数)和 31B Dense。全系列原生支持多模态(文本+图像+视频+音频)、256K 超长上下文窗口、Function Calling,且对消费级 GPU 极

#服务器#运维
到底了