
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
在昇腾 910B 环境部署 DeepSeek-V4 的实践教程。

本文实测 GPUStack 在 H20 与昇腾 910B 上部署 DeepSeek-V4-Flash-0731,解析 DSpark 加速、长上下文性能及生产配置建议。

本文实测 GPUStack 在 H20 与昇腾 910B 上部署 DeepSeek-V4-Flash-0731,解析 DSpark 加速、长上下文性能及生产配置建议。

本文由 GPUStack 社区用户实测分享整理。DeepSeek-V4-Flash-DSpark 是在 DeepSeek-V4-Flash 基础上挂载了投机解码(Speculative Decoding)模块的增强版本——同一份权重,额外的投机模块,让吞吐和首 Token 时延同时变好。社区用户拿到模型当天(Day 0)就在的环境上,通过 GPUStack 完成了部署和压测,并和原生 DeepSe

本文由 GPUStack 社区用户实测分享整理。GLM-5.2-FP8-DSpark 是在 GLM-5.2-FP8 基础上,通过挂载 RedHatAI 提供的外置草稿模型(Speculator)做投机解码(Speculative Decoding)的增强方案——同一份主模型权重,额外加载一个草稿模型,用来提升解码吞吐。社区用户在模型放出当天(Day 0)就在 8 卡 H20-141G 环境上,通过

本文记录 Kimi-K3 在单机 8×NVIDIA B300 环境中的部署与压测过程,并对 vLLM、SGLang 两套推理引擎在 64K 与 200K 长上下文场景下的表现进行拆解。

本文以单台 8×B300 服务器为例,演示如何在 GPUStack 中接入 TileRT 定制 vLLM 后端,完成 GLM-5.1 的 Prefill / Decode(PD)分离部署、路由配置与性能验证。

本文由 GPUStack 社区用户实测分享整理。DeepSeek-V4-Flash-DSpark 是在 DeepSeek-V4-Flash 基础上挂载了投机解码(Speculative Decoding)模块的增强版本——同一份权重,额外的投机模块,让吞吐和首 Token 时延同时变好。社区用户拿到模型当天(Day 0)就在的环境上,通过 GPUStack 完成了部署和压测,并和原生 DeepSe

通过 GPUStack 提供高效的模型部署与管理能力,并将模型接入 MaxKB,即可轻松构建具备知识库检索 + 智能问答能力的 AI 助手。

本文由 GPUStack 社区用户实测分享整理。GLM-5.2-FP8-DSpark 是在 GLM-5.2-FP8 基础上,通过挂载 RedHatAI 提供的外置草稿模型(Speculator)做投机解码(Speculative Decoding)的增强方案——同一份主模型权重,额外加载一个草稿模型,用来提升解码吞吐。社区用户在模型放出当天(Day 0)就在 8 卡 H20-141G 环境上,通过








