
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
2026 年 4 月 2 日,Google DeepMind 发布了 Gemma 4 系列开源模型(Apache 2.0 协议),包含 4 个规格:E2B(20亿有效参数)、E4B(40亿)、12B Dense、26B MoE(~38亿激活参数)和 31B Dense。全系列原生支持多模态(文本+图像+视频+音频)、256K 超长上下文窗口、Function Calling,且对消费级 GPU 极
文章摘要:作者在48GB显存的AMD GPU实例上已部署Gemma 4模型(占用32.7GB),决定利用剩余15GB显存再部署一个轻量级模型。经过对比选择Qwen2.5-3B-Instruct中文模型,尝试使用vLLM部署时遭遇ROCm兼容性问题,最终改用transformers直接加载。验证显示该方案推理速度快(430+ it/s),能满足中文场景需求,且资源占用合理(约6GB显存)。整个过程体
文章摘要:作者在48GB显存的AMD GPU实例上已部署Gemma 4模型(占用32.7GB),决定利用剩余15GB显存再部署一个轻量级模型。经过对比选择Qwen2.5-3B-Instruct中文模型,尝试使用vLLM部署时遭遇ROCm兼容性问题,最终改用transformers直接加载。验证显示该方案推理速度快(430+ it/s),能满足中文场景需求,且资源占用合理(约6GB显存)。整个过程体
本文介绍了Datawhale与AMD联合发布的Hello-ROCm项目,这是国内首个系统性ROCm中文开源教程,覆盖环境搭建、模型部署、微调到底层优化的全流程。教程分为四个阶段,支持Qwen3和Gemma4等模型,亮点包括中文文档、AI工具集成和云端GPU环境。重点演示了在AMD云环境中的模型微调实践,使用LoRA技术将通用模型改造为情感分析专家,仅需少量参数调整即可达到85%+的准确率。实践表明
2026 年 4 月 2 日,Google DeepMind 发布了 Gemma 4 系列开源模型(Apache 2.0 协议),包含 4 个规格:E2B(20亿有效参数)、E4B(40亿)、12B Dense、26B MoE(~38亿激活参数)和 31B Dense。全系列原生支持多模态(文本+图像+视频+音频)、256K 超长上下文窗口、Function Calling,且对消费级 GPU 极







