DeepSpec:DeepSeek开源推测解码框架,发布当天6K星

2026年6月26日,DeepSeek开源了DeepSpec——一个完整的推测解码训练和评估框架,发布当天获得6.2K星标。这个框架让大模型推理加速从"黑盒优化"变成了"可训练、可评估、可复现"的工程流程。

一、推测解码是什么

大模型推理的速度瓶颈在自回归生成——每次生成一个token,无法并行。推测解码的核心思路是用一个小模型(draft model)快速生成多个候选token,然后用大模型(target model)一次性验证这些token是否正确。正确率高的部分可以一次性接受,从而加速生成过程。

在实际应用中,推测解码通常能带来2-3倍的加速,具体取决于draft model的质量和target model的接受率。接受率越高,加速效果越好。

GLM-5.2的MTP(Multi-Token Prediction)和DeepSeek V4的推测解码都用了类似的技术。但之前的问题是:每个模型用自己的方案实现,没有统一的训练和评估框架。

DeepSpec的出现改变了这一点——它提供了一个完整的流程:准备数据、训练draft model、评估效果,支持三种不同的推测解码算法。

二、DeepSpec的核心流程

DeepSpec的工作流程分为三个阶段,每个阶段的输出作为下一个阶段的输入:

阶段1:数据准备

这个阶段需要准备训练draft model所需的数据。具体步骤:

  1. 下载训练用的prompt数据

  2. 用target model重新生成答案(需要部署一个推理服务来serve target model)

  3. 构建target cache——缓存target model的输出,用于后续训练

这里有一个重要的工程细节:target cache的体积非常大。DeepSpec的README明确提到,默认配置下(以Qwen3-4B为target model),target cache大约需要38TB的存储空间。

38TB的cache来自哪里?推测解码的draft model训练需要target model在大量prompt上的完整输出分布,而不仅仅是最终的token序列。这个分布信息需要用target model逐token生成并保存,数据量自然巨大。

阶段2:训练

数据准备完成后,用train.sh启动训练:

bash scripts/train/train.sh

train.py会在所有可见GPU上启动worker。核心参数通过config_path指定,指向config/目录下的配置文件。

支持三种算法的配置:

  • config/dspark/——DSpark算法

  • config/dflash/——DFlash算法

  • config/eagle3/——Eagle3算法

每个算法支持多种target model:Qwen3-4B、Qwen3-8B、Qwen3-14B、Gemma-4-12B。

训练完成后,checkpoint写入~/.checkpoints目录。

硬件要求:默认配置假设单节点8GPU。如果只有4GPU,用CUDA_VISIBLE_DEVICES控制。

阶段3:评估

训练完成后,用eval.sh评估效果:

bash scripts/eval/eval.sh

评估覆盖9个基准数据集:gsm8k(数学推理)、math500(数学)、aime25(竞赛数学)、humaneval(代码生成)、mbpp(代码生成)、livecodebench(代码)、mt-bench(多轮对话)、alpaca(指令跟随)、arena-hard-v2(困难指令)。

评估的核心指标是acceptance length——draft model生成的token中被target model接受的比率。这个指标直接决定推理加速的效果。

三、三种算法的技术差异

DeepSpec包含了三种推测解码算法,每种有不同的技术思路:

Eagle3

Eagle系列是DeepSeek之前已经开源的推测解码方案。Eagle3的核心思路是用一个轻量级的Transformer作为draft model,预测target model在下一个位置的输出分布。

Eagle3的draft model是一个独立的模型,直接预测下一个token的概率分布,和target model的解码过程独立。它的优点是架构简单,训练和推理的工程实现直接。

DFlash

DFlash的论文在arXiv上(2602.06036)。和Eagle3不同,DFlash的draft model不是预测整个token分布,而是预测一个"粗粒度"的表示,然后通过一个轻量级的映射层还原为token分布。

这个设计的意图是:draft model不需要精确预测每个token的概率,只需要预测一个足够好的近似表示,由映射层做最后的精调。理论上可以用更小的draft model达到和Eagle3接近的接受率。

DSpark

DSpark是DeepSpec中新提出的算法(附有单独的论文PDF)。DSpark在DFlash的基础上增加了一个"自回归验证"机制——draft model生成的候选token不仅由target model一次性验证,还会经过一轮自回归精化。

这个机制的目的是提高接受率。一次性验证可能漏掉一些目标分布中概率不低但不在候选列表中的token,自回归精化可以弥补这个问题。

三种算法的对比如下:

算法 draft model设计 验证方式 接受率(Qwen3-4B)
Eagle3 独立Transformer 一次性验证 基准
DFlash 粗粒度表示+映射层 一次性验证 ~与Eagle3接近
DSpark 粗粒度表示+映射层 自回归精化验证 比DFlash高

表格中的接受率数据来自DeepSpec论文的Table 1,三种算法在相同target model下的接受率对比。

四、这个框架的意义

DeepSpec的意义不在算法本身——Eagle3和DFlash之前已经存在。它的意义在于提供了一个完整的、统一的训练和评估框架。

在此之前的推测解码研究面临的问题:每个论文用自己的数据、自己的训练流程、自己的评估方式。A论文说自己的算法加速3倍,B论文说自己的算法加速2.5倍,但两者的训练数据和评估基准不同,无法直接比较。

DeepSpec用统一的数据准备流程、统一的训练脚本、统一的评估基准和数据集,让三种算法可以在完全相同的条件下进行公平对比。这对推测解码领域的研究和工程实践都有价值。

五、适用场景

适合使用DeepSpec的场景

有需要部署大模型的推理服务,且对延迟敏感。推测解码可以在不牺牲输出质量的前提下,将推理速度提升2-3倍。

有足够的硬件资源。数据准备阶段需要38TB(默认配置)的存储空间来构建target cache,训练阶段需要8GPU的算力。硬件投入不小。

需要对推理速度做系统化的优化——不是通过降低模型质量来提升速度,而是通过工程手段优化。

不适合的场景

单次推理或小规模部署——推测解码的训练和配置成本在单次推理场景中无法摊销。

硬件资源受限——38TB的存储和8GPU的算力不是所有团队都具备的。

对推理速度要求不高——如果当前推理速度已经满足需求,推测解码的收益体现不出来。

六、定位

DeepSpec定位是一个研究和工程框架,不是即开即用的推理加速工具。它提供的是一套完整的训练和评估工具链,用户需要自己训练draft model,然后将其集成到自己的推理服务中。

从开源当天6.2K星标来看,推测解码是当前大模型推理优化领域最受关注的方向之一。GLM-5.2用MTP、DeepSeek V4用推测解码、DeepSpec提供了一个统一框架——2026年下半年推理速度的竞争正在从模型能力竞争转向推理效率竞争。

七、总结

  • DeepSpec是DeepSeek在2026年6月26日开源的推测解码框架,发布当天6.2K星标

  • 三阶段流程:数据准备(需38TB cache)→训练(8GPU)→评估(9个基准数据集)

  • 三种算法:Eagle3(独立Transformer)、DFlash(粗粒度+映射层)、DSpark(自回归精化)

  • 统一框架的意义在于让不同算法可以在相同条件下公平对比

  • 适合:大模型推理服务、对延迟敏感、有硬件资源的团队

  • 不适合:单次推理、硬件受限、速度需求不高

  • 2026年下半年推理效率是大模型竞争的新战场

更多推荐