登录社区云,与社区用户共同成长
邀请您加入社区
本文详细介绍了如何在云端算力平台上使用4张vGPU高效部署Qwen3-32B模型,并通过sglang框架实现稳定服务。重点讲解了资源利用率优化和依赖管理,包括环境准备、模型获取、多卡部署配置技巧以及常见依赖冲突解决方案,帮助开发者快速掌握大型语言模型的云端部署技术。
本文针对使用SGLang框架在Atlas 800I A2双机环境下部署DeepSeek-V3.2-W8A8(W8A8量化)模型时,出现服务拉起过程中“Capturing batches”阶段卡死的问题,结合实际排查过程,系统性地梳理了问题根因与解决方案,为类似场景提供可复用的优化路径。模型权重未启用MTP量化,但启动命令中启用了MTP相关参数,导致运行时异常。设置过小,无法满足长序列场景下的集体
本文记录 Kimi-K3 在单机 8×NVIDIA B300 环境中的部署与压测过程,并对 vLLM、SGLang 两套推理引擎在 64K 与 200K 长上下文场景下的表现进行拆解。
摘要:本文详细记录了在一台双卡GPU机器上部署DeepSeek-V4-Flash-0731模型的全过程,包括环境配置、工具调用修复和性能验证。部署采用SGLang 0.5.16推理框架,支持1M上下文长度,通过OpenAI兼容API提供服务。文章重点解决了工具调用解析、CUDA环境修复等关键问题,并确认当前部署使用的是官方完整Flash精度(部分FP4/FP8量化)。首次启动需约21分钟完成编译和
摘要: 开源框架Slime重塑大模型强化学习训练范式,以简洁的三模块架构(训练、推理、数据缓冲)实现生产级RL流水线,核心设计包括正确性优先、原生透传和开放数据接口。其工程化能力支撑智谱GLM-5.2仅用2天完成OPD后训练,性能提升显著,并兼容多款主流基座模型。围绕Slime已衍生12个生态项目,覆盖全模态RL、智能体优化等场景,形成技术生态位。开源后引发行业热议,智谱创始人唐杰与马斯克就中国模