DeepSeek DSpark 来了:推理速度提升 85%,用户能感知到什么?
2026 年 6 月 27 日,DeepSeek 联合北京大学发布 DSpark 推理加速框架,同步开源全栈工具链 DeepSpec。创始人梁文锋署名论文,这是 DeepSeek 完成 500 亿元首轮融资后的首个重大开源动作。
一、DSpark 是什么?不是什么?
先搞清楚一件事:DSpark 不是一个新模型。
它不是 DeepSeek-V5,不是更大的参数规模,也不是更强的推理能力。DSpark 是在 DeepSeek-V4-Flash(284B 参数) 和 DeepSeek-V4-Pro(1.6T 参数) 基础上增加的一个推测解码(Speculative Decoding)推理加速模块。
打个比方:原来 V4 模型是逐字逐句地写回答,像一个人踩着石头过河,踩一块、看一块、再踩下一块。DSpark 相当于给这个系统配了一个"侦察兵"——先跑几步探路,猜出大概率要走的方向,然后让主力模型一次性验证这一串猜测。猜对了,直接跳过去;猜错了,丢弃重来,输出质量不变。
关键:DSpark 保证输出分布与原始模型完全一致(数学上由拒绝采样保证),所以加速不会降质。
二、两个核心创新
DSpark 的技术突破来自两项互补机制:
2.1 半自回归生成(Semi-Autoregressive Generation)
传统并行草稿模型一次猜多个 token,速度快,但后面的 token 猜得不准("后缀衰减"问题)。DSpark 保留并行主干的高吞吐,同时加入一个轻量级的串行模块(仅 2 层 Transformer),让草稿模型在猜后面的 token 时参考前面已猜的结果。效果:用更少的层数(2 层 vs 5 层)取得比纯并行模型更高的接受率。
2.2 置信度调度验证(Confidence-Scheduled Verification)
这是一个更聪明的"审核机制"。DSpark 引入了一个置信度头(Confidence Head),评估每个草稿 token 被接受的概率。然后一个硬件感知调度器根据当前系统负载动态决定验证长度:
- 低负载时:拉满验证长度,让更多草稿 token 通过
- 高负载时:裁剪低置信度的尾部 token,把算力留给真正有价值的候选
这解决了一个重要的工程问题:传统推测解码在高并发下会浪费大量算力验证注定被拒绝的 token,DSpark 让验证预算变得灵活而非固定。
三、性能提升数据
| 指标 | V4-Flash | V4-Pro |
|---|---|---|
| 单用户生成速度提升 | 60%~85% | 57%~78% |
| 严格时延约束下吞吐量提升(Flash 120 tok/s, Pro 50 tok/s) | 661% | 406% |
| 同等吞吐下吞吐量提升(Flash 80 tok/s, Pro 35 tok/s) | 51% | 52% |
661% 和 406% 这些看似夸张的数字出现在旧方案接近性能悬崖的场景:当 MTP-1 基线在高并发下只能维持少量并发请求时,DSpark 大幅扩展了可服务的并发边界。
跨模型泛化
DSpark 不限于 DeepSeek 自家模型。在 Qwen3-4B/8B/14B 上,DSpark 的 token 接受长度比 Eagle3 提升 26.7%~30.9%,比 DFlash 提升 16.3%~18.4%。Gemma4-12B 也有类似增益。
四、用户如何感知到 DSpark?
4.1 如果你通过 DeepSeek API 调用 V4
你不需要做任何事。 DSpark 已经在 DeepSeek-V4-Flash 和 V4-Pro 的预览版服务端默认启用。它不是 API 上的一个可选参数或开关,而是后端的底层优化。
你感知到的变化:
- 响应更快了:同样的问题,首 token 延迟更低,整体生成时间缩短。如果你之前用过 V4 预览版,6 月 27 日之后应该能明显感觉到回答"出字"速度变快
- 高峰时段更稳定:DSpark 在高并发下主动裁减低价值 token 验证,减少算力浪费,所以晚高峰时 API 不那么容易"转圈"了
- 回答质量不变:数学上保证输出分布一致,你得到的内容和之前完全一样,只是更快
简单说就是:不知不觉变快了,质量没变。
4.2 如果你在 chat.deepseek.com 上使用
Web 端的体验同样受益。如果你在 6 月 27 日之后使用 DeepSeek-V4 对话,生成回复的流畅度应该有可感知的提升,尤其是长回答场景。
4.3 如果你自己部署开源模型
DSpark 的模型权重和完整训练代码已开源(MIT 协议):
- HuggingFace:DeepSeek-V4-Pro-DSpark / Flash-DSpark
- GitHub:DeepSpec(全栈训练与评估工具链)
支持通过 vLLM、SGLang、Transformers、Docker Model Runner 等框架加载推理。也可以为自己的模型(Qwen、Gemma 等)训练定制草稿模型。
⚠️ 注意:DeepSpec 完整训练管线默认需要 8 GPU + ~38TB 缓存,适合有一定基础设施的团队。直接用已训练好的 DSpark checkpoint 推理则门槛低得多。
4.4 怎么验证是否真的有加速?
你可以做一个简单的前后对比(如果你之前记录过 V4 的响应速度):
# 用 time 命令对比生成速度
time curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash",
"messages": [{"role": "user", "content": "写一篇800字的文章关于人工智能的未来"}],
"stream": true
}' > /dev/null
或者更直观的:在 chat.deepseek.com 问同一个长问题,感受生成速度的变化。
五、关于 V4 正式版和定价
DeepSeek-V4 正式版计划于 2026 年 7 月中旬上线,届时将同步引入峰谷定价机制:
| 时段 | 价格 |
|---|---|
| 高峰(每日 9:00-12:00, 14:00-18:00) | 翻倍 |
| 其余时段 | 维持现行价格 |
DSpark 的部署可以在一定程度上缓解高峰时段的算力压力,但定价策略更多反映的是算力供需关系,而非技术成本。
六、总结
DSpark 标志着大模型竞争的一个转折点:从"拼参数规模"转向"拼落地效率"。它不追求更大的模型,而专注于让现有模型跑得更快、更省、更稳。
对于普通用户,DSpark 意味着:
- 更快的响应速度(60%~85%)
- 更稳定的服务(高并发不再崩溃)
- 完全相同的输出质量
- 无需任何配置,即开即用
对于开发者,DSpark + DeepSpec 的开源意味着可以将同样的加速技术应用到自己的模型中,这可能是自推测解码技术提出以来,最完整的工程化开源实现。
参考链接
- DSpark 论文
- DeepSpec GitHub 仓库 (MIT)
- DeepSeek-V4 技术报告 (arXiv)
- HuggingFace - DeepSeek-V4-Pro-DSpark
- TechTimes 报道
- Computing 报道
- TheOutpost 深度分析
如果您觉得有用,欢迎 点赞、转发、评论、关注。
更多推荐
所有评论(0)