大模型推理加速:2026年6-8月重要论文与进展
大模型推理加速:2026年6-8月重要论文与进展
调研截止:2026年8月6日 | 覆盖方向:投机解码、KV缓存优化、扩散语言模型、系统级优化
一、投机解码(Speculative Decoding)
这是近两个月最密集的方向。EAGLE-3(NeurIPS 2025)已成为 vLLM、SGLang、TensorRT-LLM 的默认基线,新工作普遍以超越 EAGLE-3 为对标。
1. DSpark — DeepSeek + 北京大学(6月27日)
论文: DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation
开源: DeepSpec(MIT许可,内置 DSpark / DFlash / Eagle3)
核心问题: 并行草稿模型(如 DFlash)一次前向生成整个候选块,速度快,但各位置独立预测,无法建模 token 间依赖,导致后段接受率快速衰减(suffix decay)。
两项互补机制:
- 半自回归生成架构: 并行主干保持高吞吐,末端附加轻量级串行头(Markov 头或 RNN 头)注入前缀依赖。两层 Transformer 深度的 DSpark 即可超越五层 DFlash 的接受长度。
- 置信度调度验证: 置信度头评估每个 token 的"存活概率",硬件感知调度器根据实时引擎吞吐动态决定最优验证长度,优先将算力分配给预期回报最高的 token。还设计了"时序温度缩放"校准置信度过高的问题。
实测数据(生产部署):
- DeepSeek-V4-Flash:单用户生成速度提升 60%-85%
- DeepSeek-V4-Pro:提升 57%-78%
- Qwen3-4B/8B/14B 宏平均接受长度较 Eagle3 提升 30.9%/26.7%/30.0%
- 已兼容 Qwen3、Gemma4-12B 等主流基座
亮点: 创始人梁文锋亲自署名,已完成真实用户流量落地验证,非纯实验室结果。DSpark 兼容多模型、全开源,对缺乏底层算法团队的中小企业降低私有化部署门槛。
2. JetSpec — 阶跃星辰 + UCSD(6月)
论文: JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting (arXiv:2606.18394)
开源: GitHub | 模型权重
核心思路: 用因果并行树生成(Causal Parallel Tree Drafting)同时解决"草稿成本"和"接受率"两个维度。通过树形因果注意力掩码(tree-causal attention mask),每个树节点只能看到原始前缀和本分支祖先 token,所有节点在一次前向中并行计算,同时保持分支内自回归依赖。
关键数据:
- Qwen3-8B 上端到端最高 9.64x 加速(vs 标准自回归)
- MATH-500 上一次验证平均接受 10.76 个 token
- HumanEval 7.12x、LiveCodeBench 7.67x、MT-Bench 4.58x
- 树预算从 16 增至 128 时,吞吐从 443 TPS 升至 968 TPS
- B200 单卡 batch=1 预算 127 时,MATH-500 吞吐约 1000 TPS
与 DSpark 的互补关系: DSpark 面向高并发、预算受限场景(系统层面减少无效计算);JetSpec 面向低延迟、计算预算充足场景(算法层面提高有效 token 生成率)。两者共同指向"因果性"成为下一代投机解码的关键。
vLLM 集成: 已实现基于 vLLM fork 的服务端推理,支持 paged FlashAttention(Triton + CuTe DSL)直接在 attention 计算中应用树掩码。
3. Saguaro (SSD) — Stanford / Princeton / Together AI(ICLR 2026)
论文: Speculative Speculative Decoding (arXiv:2603.03251)
作者: Tanishq Kumar, Tri Dao(FlashAttention 作者), Avner May
核心创新: “嵌套投机”——在目标模型验证草稿期间,草稿模型不闲置,而是预测验证结果并提前准备下一轮投机。如果预测命中,下一轮草稿瞬间返回,消除起草延迟。
技术要点:
- 最优缓存结构遵循几何扇出序列,浅层集中更多 token
- Bonus token 预测:用 draft logits 预测目标模型采样结果,命中率约 90%
- 需要独立 GPU 跑草稿模型(论文用 4x H100 跑目标 + 1x H100 跑草稿)
性能:
- Llama-3.1-70B:255.8 tok/s(vs SD 161.8,AR 54.7),较 SD 提升 1.58x
- 平均比优化后的 SD 基线快 30%,比自回归快最高 5x
- 在所有 batch size 下改善吞吐-延迟 Pareto 前沿
限制: 需要专用 GPU 给草稿模型,单卡部署不适用。
4. 其他投机解码重要工作
| 论文 | 会议/时间 | 核心贡献 | 关键数据 |
|---|---|---|---|
| HCSpec | ACL 2026 | 双层水平级联投机解码,位置特化的异构草稿模块 | 超 EAGLE-3 15-30%,最高 3.72x |
| PARD | ICLR 2026 | 目标模型无关的并行草稿,单一草稿模型适配整个模型家族 | LLaMA3.1-8B 3.67x,264.88 tok/s |
| Aurora | arXiv 2月 | RL 在线学习草稿模型,训练-推理一体化系统 | Day-0 即用 1.5x,分布漂移额外 1.25x |
| Nightjar | JSA 2026 | 资源感知自适应投机框架,动态选择投机长度,高负载时关闭投机并卸载草稿模型 | 吞吐 +14.76%,延迟 -20.18% |
| AHSD | Neurocomputing 8月 | 自适应混合投机解码,置信度驱动的两阶段 token 处理 + 桶批处理 | 2.4x 加速,2.48x 吞吐 |
| SpecVocab | ACL Findings 2026 | 投机词表——每步动态选择词表子集,而非缩减词表 | 超 EAGLE-3 吞吐 8.1% |
| CAST | ICLR 2026 | 推理成本感知的动态树构建,考虑 GPU 配置和 batch size | — |
二、KV 缓存优化
1. TurboQuant — Google(2026)
将 KV 向量从笛卡尔坐标转为极坐标(PolarQuant),消除逐块归一化元数据。对 Key 添加基于 Johnson-Lindenstrauss 变换的 1-bit 校正层(QJL)。
- 2.5-3 bits/value(从 16 bits 降下来),6x 压缩,零精度损失
- 无需校准数据,即插即用
- H100 上 attention kernel 加速最高 8x
- 已有 PyTorch (Triton)、MLX、llama.cpp 社区实现
2. Lynx — arXiv 7月2日(投稿 SIGCOMM 2026)
面向解聚合推理(Prefill/Decode 分离)的 KV 传输瓶颈。将 KV 缓存分为高优先级 Anchor 流(MSB,约 4 bits)和低优先级 Residual 流(LSB,约 4 bits),Anchor 到达后立即启动推测解码,Residual 到达后一次验证保证输出一致。
- INT4 级 TTFT + BF16 精度(此前无方案同时实现)
- 较标准 INT8 KV 量化 TTFT 提升 1.43x
- Qwen3-235B 128K context:25 Gbps 链路下原需约 7.5s 传输
3. DASH-KV — ACL 2026 Findings
将注意力重构为近似最近邻搜索,用非对称深度哈希(Query 用 3 层 MLP,Key 用线性投影)将浮点相似度计算替换为汉明距离比特操作。
- O(N²) → O(N),性能匹配全注意力
- 配合跨头共识和跨层动量校准
4. FreqDepthKV — arXiv 7月7日
将相邻层 KV 状态分解为共享低频深度分量 + 稀疏高频残差,轻量在线探针为每个注意力头分配共享/残差/精确缓存模式。
- 32K context 下 3.9x 有效压缩比
- 解码吞吐 70.4 tok/s,TTFT 2.06s,峰值 KV 内存 6.2 GB
三、扩散语言模型(Diffusion LLM)
这条路线试图用扩散生成替代自回归解码,从范式层面解决推理瓶颈。
1. Mercury 2 — Inception Labs
用扩散在 8-16 步内将随机噪声精炼为完整文本序列,Blackwell GPU 上达到 1009 tok/s,端到端延迟 1.7s,约比 Claude 4.5 Haiku / GPT-5 Mini 快 10x。AIME 2025 得分 91.1,已进入推理能力梯队。
意义: 如果扩散 LLM 成熟到前沿质量,整个自回归推理优化栈将变得无关。目前质量差距在缩小但未闭合,且扩散天然支持填充(infilling)和纠错。
2. FlashDLM — Cornell(ICLR 2026)
两项 training-free 技术加速扩散语言模型:
- FreeCache: 跨去噪步骤复用稳定的 KV 投影,减少计算成本
- Guided Diffusion: 用轻量预训练自回归模型监督 token 解掩码,大幅减少去噪迭代次数
平均 12.14x 端到端加速,首次使扩散 LM 延迟与自回归模型相当。
四、系统级优化
1. ZipServ — ASPLOS 2026(港科大)
无损权重压缩框架,与 GPU 架构协同设计:
- TCA-TBE 固定长度格式,支持常数时间并行解码
- ZipGEMM 融合解压-GEMM 内核,直接在 Tensor Core 寄存器中解压
- 模型体积减少 30%,kernel 级 2.21x(vs cuBLAS),端到端 1.22x(vs vLLM)
2. BlockPilot — 阿里巴巴 AMAP(6月30日,arXiv:2606.31315)
针对块级扩散草稿模型(如 DFlash)的固定块大小问题,实现推理时动态选择最优块大小——类似"自动换挡"。
- Qwen3-4B 上 4.20x 推理加速
- 根据输入难度在"猜得多"和"猜得准"间取最优平衡
五、核心趋势判断
-
投机解码进入系统优化阶段。 焦点从"找好草稿模型架构"转向"端到端 draft-verify 系统优化"——训练-推理一体化(Aurora 用 RL 在线学习)、负载感知调度(DSpark/Nightjar)、嵌套投机(Saguaro)。
-
并行草稿 + 因果性注入成为主流范式。 DSpark(半自回归串行头)、JetSpec(因果并行树)、HCSpec(水平级联)都在解决同一个问题:并行草稿快但缺乏 token 间依赖建模。解法各有不同,但方向一致。
-
KV 缓存优化跳出浮点框架。 TurboQuant 用极坐标、DASH-KV 用二进制哈希、Lynx 用分流传输、FreqDepthKV 用频域分解——都在尝试全新的计算范式,而非在浮点量化上做微调。
-
扩散语言模型开始挑战自回归。 Mercury 2 达到 1000+ tok/s,FlashDLM 达到 12x 加速,质量差距在缩小。虽然尚未达到前沿模型水平,但这条路线如果成熟,将使整个自回归优化栈失效。
-
生产落地加速。 DSpark 已在 DeepSeek 线上服务部署,EAGLE-3 成为三大推理框架默认,JetSpec 已集成 vLLM。从论文到生产的周期在缩短。
-
推理已取代训练成为 AI 算力主要消耗。 据 Deloitte 2026 TMT 预测,推理约占全部 AI 算力支出的 2/3(2023 年仅 1/3),推理优化芯片市场超 500 亿美元。
论文索引
| # | 论文 | 链接 |
|---|---|---|
| 1 | DSpark | arXiv:2607.05147 / DeepSpec |
| 2 | JetSpec | arXiv:2606.18394 / 项目页 |
| 3 | Saguaro (SSD) | arXiv:2603.03251 |
| 4 | HCSpec | ACL 2026 |
| 5 | PARD | ICLR 2026 |
| 6 | Aurora | arXiv:2602.06932 |
| 7 | Nightjar | JSA 2026 |
| 8 | AHSD | Neurocomputing 2026 |
| 9 | SpecVocab | ACL Findings 2026 |
| 10 | TurboQuant | 综述 |
| 11 | Lynx | arXiv:2607.01831 |
| 12 | DASH-KV | ACL Findings 2026 |
| 13 | FreqDepthKV | arXiv:2607.06519 |
| 14 | FlashDLM | ICLR 2026 |
| 15 | ZipServ | ASPLOS 2026 |
| 16 | BlockPilot | arXiv:2606.31315 |
| 写自定义目录标题) |
欢迎使用Markdown编辑器
你好! 这是你第一次使用 Markdown编辑器 所展示的欢迎页。如果你想学习如何使用Markdown编辑器, 可以仔细阅读这篇文章,了解一下Markdown的基本语法知识。
新的改变
我们对Markdown编辑器进行了一些功能拓展与语法支持,除了标准的Markdown编辑器功能,我们增加了如下几点新功能,帮助你用它写博客:
- 全新的界面设计 ,将会带来全新的写作体验;
- 在创作中心设置你喜爱的代码高亮样式,Markdown 将代码片显示选择的高亮样式 进行展示;
- 增加了 图片拖拽 功能,你可以将本地的图片直接拖拽到编辑区域直接展示;
- 全新的 KaTeX数学公式 语法;
- 增加了支持甘特图的mermaid语法1 功能;
- 增加了 多屏幕编辑 Markdown文章功能;
- 增加了 焦点写作模式、预览模式、简洁写作模式、左右区域同步滚轮设置 等功能,功能按钮位于编辑区域与预览区域中间;
- 增加了 检查列表 功能。
功能快捷键
撤销:Ctrl/Command + Z
重做:Ctrl/Command + Y
加粗:Ctrl/Command + B
斜体:Ctrl/Command + I
标题:Ctrl/Command + Shift + H
无序列表:Ctrl/Command + Shift + U
有序列表:Ctrl/Command + Shift + O
检查列表:Ctrl/Command + Shift + C
插入代码:Ctrl/Command + Shift + K
插入链接:Ctrl/Command + Shift + L
插入图片:Ctrl/Command + Shift + G
查找:Ctrl/Command + F
替换:Ctrl/Command + G
合理的创建标题,有助于目录的生成
直接输入1次#,并按下space后,将生成1级标题。
输入2次#,并按下space后,将生成2级标题。
以此类推,我们支持6级标题。有助于使用TOC语法后生成一个完美的目录。
如何改变文本的样式
强调文本 强调文本
加粗文本 加粗文本
标记文本
删除文本
引用文本
H2O is是液体。
210 运算结果是 1024.
插入链接与图片
链接: link.
图片:
带尺寸的图片:
居中的图片:
居中并且带尺寸的图片:
当然,我们为了让用户更加便捷,我们增加了图片拖拽功能。
如何插入一段漂亮的代码片
去博客设置页面,选择一款你喜欢的代码片高亮样式,下面展示同样高亮的 代码片.
// An highlighted block
var foo = 'bar';
生成一个适合你的列表
- 项目
- 项目
- 项目
- 项目
- 项目1
- 项目2
- 项目3
- 计划任务
- 完成任务
创建一个表格
一个简单的表格是这么创建的:
| 项目 | Value |
|---|---|
| 电脑 | $1600 |
| 手机 | $12 |
| 导管 | $1 |
设定内容居中、居左、居右
使用:---------:居中
使用:----------居左
使用----------:居右
| 第一列 | 第二列 | 第三列 |
|---|---|---|
| 第一列文本居中 | 第二列文本居右 | 第三列文本居左 |
SmartyPants
SmartyPants 是一个文本转换工具,主要功能是将普通的 ASCII 标点符号自动转换为更美观的印刷体标点符号。例如:
| 原始符号 | 转换后 | 说明 |
|---|---|---|
"引号" |
“引号” | 直引号变弯引号 |
'单引号' |
‘单引号’ | 直单引号变弯单引号 |
-- |
– | 两个连字符变短破折号 |
--- |
— | 三个连字符变长破折号 |
... |
… | 三个点变省略号 |
创建一个自定义列表
-
Markdown
- Text-to- HTML conversion tool Authors
- John
- Luke
如何创建一个注脚
一个具有注脚的文本。2
注释也是必不可少的
Markdown将文本转换为 HTML。
KaTeX数学公式
您可以使用渲染LaTeX数学表达式 KaTeX:
Gamma公式展示 Γ ( n ) = ( n − 1 ) ! ∀ n ∈ N \Gamma(n) = (n-1)!\quad\forall n\in\mathbb N Γ(n)=(n−1)!∀n∈N 是通过欧拉积分
Γ ( z ) = ∫ 0 ∞ t z − 1 e − t d t . \Gamma(z) = \int_0^\infty t^{z-1}e^{-t}dt\,. Γ(z)=∫0∞tz−1e−tdt.
你可以找到更多关于的信息 LaTeX 数学表达式here.
新的甘特图功能,丰富你的文章
- 关于 甘特图 语法,参考 这儿,
UML图表
可以使用UML图表进行渲染,例如下面产生的一个序列图:
- 关于 UML图表 语法,参考 这儿,
流程图
- 关于 Mermaid 语法,参考 这儿,
FLowchart流程图
我们依旧会支持flowchart.js的流程图语法:
- 关于 Flowchart流程图 语法,参考 这儿.
导出与导入
导出
如果你想尝试使用此编辑器, 你可以在此篇文章任意编辑。当你完成了一篇文章的写作, 在上方工具栏找到 文章导出 ,生成一个.md文件或者.html文件进行本地保存。
导入
如果你想加载一篇你写过的.md文件,在上方工具栏可以选择导入功能进行对应扩展名的文件导入,
继续你的创作。
-
注脚的解释 ↩︎
更多推荐
所有评论(0)