信创模盒大模型推理引擎 XC-LLM在寒武纪加速卡上实现Qwen3系列模型适配
信创模盒ModelHub XC 社区进一步优化了大模型推理引擎 XC-LLM,在寒武纪MLU系列加速卡上完成对Qwen3等主流开源对话模型的适配,实现高效、稳定的文本生成推理能力。
Qwen系列在开源开发者生态中长期保持高热度与高使用量,在多个模型社区平台的累计下载量达数亿级,并持续形成庞大的衍生模型与开发者社区。但在国产算力落地中,一直存在适配缺口:在寒武纪MLU370-X4/X8环境里,官方vLLM路线对Qwen3并非默认支持,推理性能与部署体验受到影响。
本次XC-LLM的升级,核心就是补齐这个缺口,通过修复编码兼容性问题、深度优化处理逻辑、提升自动化适配能力,成功在寒武纪MLU370-X4/X8上解决了Qwen3系列模型的关键适配与工程化增强,显著提升文本生成吞吐量、响应速度和中英文混合文本处理能力。除Qwen外,本次适配同步支持Llama-2、ChatGLM3等主流开源对话模型,并针对工业场景问题提供系统性解决方案,帮助企业级开发者能够更加方便、快捷、稳定的在寒武纪算力上完成常用开源模型部署,不再被框架支持范围卡住,减少从验证到上线的反复试错成本。
本次适配的核心不仅是“换了一个模型”,更是把引擎框架能力做实、做通用,主要体现在:
1)引擎框架的升级:进一步优化了XC-LLM的模型加载、算子链路与推理流程,确保Qwen3、Llama-2、ChatGLM3等主流开源对话模型在寒武纪平台上实现高效产出。
2)面向生产的稳定性增强:针对推理服务中常见的工程问题,完善了张量/内存相关的稳定性处理与边界保护机制,确保模型在寒武纪平台的稳定输出。
3)通用化接入能力沉淀:把一次性适配工作沉淀为可复用的方法与组件,降低后续新模型接入成本,让更多开源模型在寒武纪平台能够更加“高效低成本”的部署上线。
作为面向信创算力场景的推理引擎,XC-LLM 将持续围绕“新模型支持更快速、生产部署更稳定、资源消耗更节省”的目标进行迭代。后续将继续加快模型的适配进度,结合平台特性推进量化、蒸馏等更经济的推理方案,并进一步面向重点行业沉淀可直接落地的场景优化能力,推动国产 AI 软硬协同与生态完善。
关于我们:
ModelHub XC 信创模盒是一个众创共享的国产化算力和模型开源社区,致力于打造国产化算力开发者和生态厂商合作共赢的开放平台,成为“最新最全的国产算力模型社区”,让每一个优秀模型都能在国产化算力平台上生根发芽,推动 AI 国产化事业快速升级。 如有相关业务需要,请联系我们:
-
信创模盒 ModelHub XC 官网:
-
信创模盒 ModelHub XC 社区:
更多推荐



所有评论(0)