大模型推理加速:2026年6-8月重要论文与进展

调研截止:2026年8月6日 | 覆盖方向:投机解码、KV缓存优化、扩散语言模型、系统级优化


一、投机解码(Speculative Decoding)

这是近两个月最密集的方向。EAGLE-3(NeurIPS 2025)已成为 vLLM、SGLang、TensorRT-LLM 的默认基线,新工作普遍以超越 EAGLE-3 为对标。

1. DSpark — DeepSeek + 北京大学(6月27日)

论文: DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation
开源: DeepSpec(MIT许可,内置 DSpark / DFlash / Eagle3)

核心问题: 并行草稿模型(如 DFlash)一次前向生成整个候选块,速度快,但各位置独立预测,无法建模 token 间依赖,导致后段接受率快速衰减(suffix decay)。

两项互补机制:

  • 半自回归生成架构: 并行主干保持高吞吐,末端附加轻量级串行头(Markov 头或 RNN 头)注入前缀依赖。两层 Transformer 深度的 DSpark 即可超越五层 DFlash 的接受长度。
  • 置信度调度验证: 置信度头评估每个 token 的"存活概率",硬件感知调度器根据实时引擎吞吐动态决定最优验证长度,优先将算力分配给预期回报最高的 token。还设计了"时序温度缩放"校准置信度过高的问题。

实测数据(生产部署):

  • DeepSeek-V4-Flash:单用户生成速度提升 60%-85%
  • DeepSeek-V4-Pro:提升 57%-78%
  • Qwen3-4B/8B/14B 宏平均接受长度较 Eagle3 提升 30.9%/26.7%/30.0%
  • 已兼容 Qwen3、Gemma4-12B 等主流基座

亮点: 创始人梁文锋亲自署名,已完成真实用户流量落地验证,非纯实验室结果。DSpark 兼容多模型、全开源,对缺乏底层算法团队的中小企业降低私有化部署门槛。


2. JetSpec — 阶跃星辰 + UCSD(6月)

论文: JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting (arXiv:2606.18394)
开源: GitHub | 模型权重

核心思路: 用因果并行树生成(Causal Parallel Tree Drafting)同时解决"草稿成本"和"接受率"两个维度。通过树形因果注意力掩码(tree-causal attention mask),每个树节点只能看到原始前缀和本分支祖先 token,所有节点在一次前向中并行计算,同时保持分支内自回归依赖。

关键数据:

  • Qwen3-8B 上端到端最高 9.64x 加速(vs 标准自回归)
  • MATH-500 上一次验证平均接受 10.76 个 token
  • HumanEval 7.12x、LiveCodeBench 7.67x、MT-Bench 4.58x
  • 树预算从 16 增至 128 时,吞吐从 443 TPS 升至 968 TPS
  • B200 单卡 batch=1 预算 127 时,MATH-500 吞吐约 1000 TPS

与 DSpark 的互补关系: DSpark 面向高并发、预算受限场景(系统层面减少无效计算);JetSpec 面向低延迟、计算预算充足场景(算法层面提高有效 token 生成率)。两者共同指向"因果性"成为下一代投机解码的关键。

vLLM 集成: 已实现基于 vLLM fork 的服务端推理,支持 paged FlashAttention(Triton + CuTe DSL)直接在 attention 计算中应用树掩码。


3. Saguaro (SSD) — Stanford / Princeton / Together AI(ICLR 2026)

论文: Speculative Speculative Decoding (arXiv:2603.03251)
作者: Tanishq Kumar, Tri Dao(FlashAttention 作者), Avner May

核心创新: “嵌套投机”——在目标模型验证草稿期间,草稿模型不闲置,而是预测验证结果并提前准备下一轮投机。如果预测命中,下一轮草稿瞬间返回,消除起草延迟。

技术要点:

  • 最优缓存结构遵循几何扇出序列,浅层集中更多 token
  • Bonus token 预测:用 draft logits 预测目标模型采样结果,命中率约 90%
  • 需要独立 GPU 跑草稿模型(论文用 4x H100 跑目标 + 1x H100 跑草稿)

性能:

  • Llama-3.1-70B:255.8 tok/s(vs SD 161.8,AR 54.7),较 SD 提升 1.58x
  • 平均比优化后的 SD 基线快 30%,比自回归快最高 5x
  • 在所有 batch size 下改善吞吐-延迟 Pareto 前沿

限制: 需要专用 GPU 给草稿模型,单卡部署不适用。


4. 其他投机解码重要工作

论文 会议/时间 核心贡献 关键数据
HCSpec ACL 2026 双层水平级联投机解码,位置特化的异构草稿模块 超 EAGLE-3 15-30%,最高 3.72x
PARD ICLR 2026 目标模型无关的并行草稿,单一草稿模型适配整个模型家族 LLaMA3.1-8B 3.67x,264.88 tok/s
Aurora arXiv 2月 RL 在线学习草稿模型,训练-推理一体化系统 Day-0 即用 1.5x,分布漂移额外 1.25x
Nightjar JSA 2026 资源感知自适应投机框架,动态选择投机长度,高负载时关闭投机并卸载草稿模型 吞吐 +14.76%,延迟 -20.18%
AHSD Neurocomputing 8月 自适应混合投机解码,置信度驱动的两阶段 token 处理 + 桶批处理 2.4x 加速,2.48x 吞吐
SpecVocab ACL Findings 2026 投机词表——每步动态选择词表子集,而非缩减词表 超 EAGLE-3 吞吐 8.1%
CAST ICLR 2026 推理成本感知的动态树构建,考虑 GPU 配置和 batch size

二、KV 缓存优化

1. TurboQuant — Google(2026)

将 KV 向量从笛卡尔坐标转为极坐标(PolarQuant),消除逐块归一化元数据。对 Key 添加基于 Johnson-Lindenstrauss 变换的 1-bit 校正层(QJL)。

  • 2.5-3 bits/value(从 16 bits 降下来),6x 压缩,零精度损失
  • 无需校准数据,即插即用
  • H100 上 attention kernel 加速最高 8x
  • 已有 PyTorch (Triton)、MLX、llama.cpp 社区实现

2. Lynx — arXiv 7月2日(投稿 SIGCOMM 2026)

面向解聚合推理(Prefill/Decode 分离)的 KV 传输瓶颈。将 KV 缓存分为高优先级 Anchor 流(MSB,约 4 bits)和低优先级 Residual 流(LSB,约 4 bits),Anchor 到达后立即启动推测解码,Residual 到达后一次验证保证输出一致。

  • INT4 级 TTFT + BF16 精度(此前无方案同时实现)
  • 较标准 INT8 KV 量化 TTFT 提升 1.43x
  • Qwen3-235B 128K context:25 Gbps 链路下原需约 7.5s 传输

3. DASH-KV — ACL 2026 Findings

将注意力重构为近似最近邻搜索,用非对称深度哈希(Query 用 3 层 MLP,Key 用线性投影)将浮点相似度计算替换为汉明距离比特操作。

  • O(N²) → O(N),性能匹配全注意力
  • 配合跨头共识和跨层动量校准

4. FreqDepthKV — arXiv 7月7日

将相邻层 KV 状态分解为共享低频深度分量 + 稀疏高频残差,轻量在线探针为每个注意力头分配共享/残差/精确缓存模式。

  • 32K context 下 3.9x 有效压缩比
  • 解码吞吐 70.4 tok/s,TTFT 2.06s,峰值 KV 内存 6.2 GB

三、扩散语言模型(Diffusion LLM)

这条路线试图用扩散生成替代自回归解码,从范式层面解决推理瓶颈。

1. Mercury 2 — Inception Labs

用扩散在 8-16 步内将随机噪声精炼为完整文本序列,Blackwell GPU 上达到 1009 tok/s,端到端延迟 1.7s,约比 Claude 4.5 Haiku / GPT-5 Mini 快 10x。AIME 2025 得分 91.1,已进入推理能力梯队。

意义: 如果扩散 LLM 成熟到前沿质量,整个自回归推理优化栈将变得无关。目前质量差距在缩小但未闭合,且扩散天然支持填充(infilling)和纠错。

2. FlashDLM — Cornell(ICLR 2026)

两项 training-free 技术加速扩散语言模型:

  • FreeCache: 跨去噪步骤复用稳定的 KV 投影,减少计算成本
  • Guided Diffusion: 用轻量预训练自回归模型监督 token 解掩码,大幅减少去噪迭代次数

平均 12.14x 端到端加速,首次使扩散 LM 延迟与自回归模型相当。


四、系统级优化

1. ZipServ — ASPLOS 2026(港科大)

无损权重压缩框架,与 GPU 架构协同设计:

  • TCA-TBE 固定长度格式,支持常数时间并行解码
  • ZipGEMM 融合解压-GEMM 内核,直接在 Tensor Core 寄存器中解压
  • 模型体积减少 30%,kernel 级 2.21x(vs cuBLAS),端到端 1.22x(vs vLLM)

2. BlockPilot — 阿里巴巴 AMAP(6月30日,arXiv:2606.31315)

针对块级扩散草稿模型(如 DFlash)的固定块大小问题,实现推理时动态选择最优块大小——类似"自动换挡"。

  • Qwen3-4B 上 4.20x 推理加速
  • 根据输入难度在"猜得多"和"猜得准"间取最优平衡

五、核心趋势判断

  1. 投机解码进入系统优化阶段。 焦点从"找好草稿模型架构"转向"端到端 draft-verify 系统优化"——训练-推理一体化(Aurora 用 RL 在线学习)、负载感知调度(DSpark/Nightjar)、嵌套投机(Saguaro)。

  2. 并行草稿 + 因果性注入成为主流范式。 DSpark(半自回归串行头)、JetSpec(因果并行树)、HCSpec(水平级联)都在解决同一个问题:并行草稿快但缺乏 token 间依赖建模。解法各有不同,但方向一致。

  3. KV 缓存优化跳出浮点框架。 TurboQuant 用极坐标、DASH-KV 用二进制哈希、Lynx 用分流传输、FreqDepthKV 用频域分解——都在尝试全新的计算范式,而非在浮点量化上做微调。

  4. 扩散语言模型开始挑战自回归。 Mercury 2 达到 1000+ tok/s,FlashDLM 达到 12x 加速,质量差距在缩小。虽然尚未达到前沿模型水平,但这条路线如果成熟,将使整个自回归优化栈失效。

  5. 生产落地加速。 DSpark 已在 DeepSeek 线上服务部署,EAGLE-3 成为三大推理框架默认,JetSpec 已集成 vLLM。从论文到生产的周期在缩短。

  6. 推理已取代训练成为 AI 算力主要消耗。 据 Deloitte 2026 TMT 预测,推理约占全部 AI 算力支出的 2/3(2023 年仅 1/3),推理优化芯片市场超 500 亿美元。


论文索引

# 论文 链接
1 DSpark arXiv:2607.05147 / DeepSpec
2 JetSpec arXiv:2606.18394 / 项目页
3 Saguaro (SSD) arXiv:2603.03251
4 HCSpec ACL 2026
5 PARD ICLR 2026
6 Aurora arXiv:2602.06932
7 Nightjar JSA 2026
8 AHSD Neurocomputing 2026
9 SpecVocab ACL Findings 2026
10 TurboQuant 综述
11 Lynx arXiv:2607.01831
12 DASH-KV ACL Findings 2026
13 FreqDepthKV arXiv:2607.06519
14 FlashDLM ICLR 2026
15 ZipServ ASPLOS 2026
16 BlockPilot arXiv:2606.31315
写自定义目录标题)

欢迎使用Markdown编辑器

你好! 这是你第一次使用 Markdown编辑器 所展示的欢迎页。如果你想学习如何使用Markdown编辑器, 可以仔细阅读这篇文章,了解一下Markdown的基本语法知识。

新的改变

我们对Markdown编辑器进行了一些功能拓展与语法支持,除了标准的Markdown编辑器功能,我们增加了如下几点新功能,帮助你用它写博客:

  1. 全新的界面设计 ,将会带来全新的写作体验;
  2. 在创作中心设置你喜爱的代码高亮样式,Markdown 将代码片显示选择的高亮样式 进行展示;
  3. 增加了 图片拖拽 功能,你可以将本地的图片直接拖拽到编辑区域直接展示;
  4. 全新的 KaTeX数学公式 语法;
  5. 增加了支持甘特图的mermaid语法1 功能;
  6. 增加了 多屏幕编辑 Markdown文章功能;
  7. 增加了 焦点写作模式、预览模式、简洁写作模式、左右区域同步滚轮设置 等功能,功能按钮位于编辑区域与预览区域中间;
  8. 增加了 检查列表 功能。

功能快捷键

撤销:Ctrl/Command + Z
重做:Ctrl/Command + Y
加粗:Ctrl/Command + B
斜体:Ctrl/Command + I
标题:Ctrl/Command + Shift + H
无序列表:Ctrl/Command + Shift + U
有序列表:Ctrl/Command + Shift + O
检查列表:Ctrl/Command + Shift + C
插入代码:Ctrl/Command + Shift + K
插入链接:Ctrl/Command + Shift + L
插入图片:Ctrl/Command + Shift + G
查找:Ctrl/Command + F
替换:Ctrl/Command + G

合理的创建标题,有助于目录的生成

直接输入1次#,并按下space后,将生成1级标题。
输入2次#,并按下space后,将生成2级标题。
以此类推,我们支持6级标题。有助于使用TOC语法后生成一个完美的目录。

如何改变文本的样式

强调文本 强调文本

加粗文本 加粗文本

标记文本

删除文本

引用文本

H2O is是液体。

210 运算结果是 1024.

插入链接与图片

链接: link.

图片: Alt

带尺寸的图片: Alt

居中的图片: Alt

居中并且带尺寸的图片: Alt

当然,我们为了让用户更加便捷,我们增加了图片拖拽功能。

如何插入一段漂亮的代码片

博客设置页面,选择一款你喜欢的代码片高亮样式,下面展示同样高亮的 代码片.

// An highlighted block
var foo = 'bar';

生成一个适合你的列表

  • 项目
    • 项目
      • 项目
  1. 项目1
  2. 项目2
  3. 项目3
  • 计划任务
  • 完成任务

创建一个表格

一个简单的表格是这么创建的:

项目 Value
电脑 $1600
手机 $12
导管 $1

设定内容居中、居左、居右

使用:---------:居中
使用:----------居左
使用----------:居右

第一列 第二列 第三列
第一列文本居中 第二列文本居右 第三列文本居左

SmartyPants

SmartyPants 是一个文本转换工具,主要功能是将普通的 ASCII 标点符号自动转换为更美观的印刷体标点符号。例如:

原始符号 转换后 说明
"引号" “引号” 直引号变弯引号
'单引号' ‘单引号’ 直单引号变弯单引号
-- 两个连字符变短破折号
--- 三个连字符变长破折号
... 三个点变省略号

创建一个自定义列表

Markdown
Text-to- HTML conversion tool
Authors
John
Luke

如何创建一个注脚

一个具有注脚的文本。2

注释也是必不可少的

Markdown将文本转换为 HTML

KaTeX数学公式

您可以使用渲染LaTeX数学表达式 KaTeX:

Gamma公式展示 Γ ( n ) = ( n − 1 ) ! ∀ n ∈ N \Gamma(n) = (n-1)!\quad\forall n\in\mathbb N Γ(n)=(n1)!nN 是通过欧拉积分

Γ ( z ) = ∫ 0 ∞ t z − 1 e − t d t   . \Gamma(z) = \int_0^\infty t^{z-1}e^{-t}dt\,. Γ(z)=0tz1etdt.

你可以找到更多关于的信息 LaTeX 数学表达式here.

新的甘特图功能,丰富你的文章

2014-01-07 2014-01-09 2014-01-11 2014-01-13 2014-01-15 2014-01-17 2014-01-19 2014-01-21 已完成 进行中 计划一 计划二 现有任务 Adding GANTT diagram functionality to mermaid
  • 关于 甘特图 语法,参考 这儿,

UML图表

可以使用UML图表进行渲染,例如下面产生的一个序列图:

王五 李四 张三 王五 李四 张三 李四想了很长时间, 文字太长了 不适合放在一行. 你好!李四, 最近怎么样? 你最近怎么样,王五? 我很好,谢谢! 我很好,谢谢! 打量着王五... 很好... 王五, 你怎么样?
  • 关于 UML图表 语法,参考 这儿,

流程图

链接

长方形

圆角长方形

菱形

  • 关于 Mermaid 语法,参考 这儿,

FLowchart流程图

我们依旧会支持flowchart.js的流程图语法:

Created with Raphaël 2.3.0 开始 我的操作 确认? 结束 yes no
  • 关于 Flowchart流程图 语法,参考 这儿.

导出与导入

导出

如果你想尝试使用此编辑器, 你可以在此篇文章任意编辑。当你完成了一篇文章的写作, 在上方工具栏找到 文章导出 ,生成一个.md文件或者.html文件进行本地保存。

导入

如果你想加载一篇你写过的.md文件,在上方工具栏可以选择导入功能进行对应扩展名的文件导入,
继续你的创作。


  1. mermaid语法说明 ↩︎

  2. 注脚的解释 ↩︎

更多推荐