为什么主流大模型都是 Decoder-only?从 BERT/T5 到 GPT 的架构演进
为什么主流大模型都是 Decoder-only?从 BERT/T5 到 GPT 的架构演进
参考:Wang et al. 2022 (arXiv:2204.05832)、GPT-3 (arXiv:2005.14165)、T5 (arXiv:1910.10683)、LLaMA (arXiv:2302.13971)、DeepSeek-V3 (arXiv:2412.19437)、Qwen2 (arXiv:2407.10671)、Hugging Face 官方博客
1. 三种 Transformer 架构:一张图看懂
Transformer 架构自 2017 年提出后演化出三条分支,核心区别在于注意力掩码——谁能"看到"谁:
| 架构 | 注意力模式 | 代表模型 | 预训练目标 |
|---|---|---|---|
| Encoder-only | 双向(bidirectional) | BERT、RoBERTa、DeBERTa | 掩码语言建模(MLM) |
| Encoder-Decoder | 双向编码 + 因果解码 + 交叉注意力 | T5、BART、Pegasus | 去噪自编码(span corruption) |
| Decoder-only | 纯因果(causal) | GPT、LLaMA、DeepSeek、Qwen、Mistral | 自回归语言建模(AR LM) |
2018–2021 年还是"三足鼎立":BERT 统治理解任务、T5/BART 统治生成任务、GPT 只是"第三条路"。到 2023 年之后,所有主流大模型几乎都收敛到了 Decoder-only——为什么?
2. 决定性证据:一篇论文终结了争论
2022 年,Google 与 CMU 发表了关键论文 《What Language Model Architecture and Pretraining Objective Work Best for Zero-Shot Generalization?》(arXiv:2204.05832),用 50 亿参数模型、1700 亿 token 做了大规模系统对比,结论明确:
causal decoder-only 模型 + 自回归语言建模目标,在纯无监督预训练后展现出最强的零样本泛化能力。
论文对比了三种架构(causal decoder-only / non-causal decoder-only / encoder-decoder)× 两种目标(自回归 / 掩码语言建模),这是第一次在同等规模下公平回答"哪种架构最好",也为此后大模型的架构选择提供了实验依据。
注意结论的另一半:如果先做多任务提示微调(multitask finetuning),非因果(双向)模型反而更强——这说明 Decoder-only 的优势主要体现在预训练后的通用能力上,而这正是大模型范式的核心。
3. 为什么 Decoder-only 胜出:六大原因
3.1 预训练与推理目标完全一致(最重要)
- Decoder-only:预训练就是"预测下一个 token",推理(生成)也是"预测下一个 token"——目标天然对齐,训练时学到的能力在推理时原样发挥
- Encoder-Decoder:预训练用去噪目标(T5 的 span corruption、BART 的文本填充),推理却是自回归生成——训练与推理存在目标偏差,模型需要在"补全"和"生成"之间切换
用最简单的类比:Decoder-only 像"从小到大一直在写作文的人",Encoder-Decoder 像"平时练填空题、考试却要写作文"。
3.2 涌现的 In-Context Learning(上下文学习)
GPT-3 论文(2020)发现:纯因果语言模型在参数量增大到一定程度后,涌现出上下文学习能力——不需要微调,给几个示例(few-shot)就能完成任务。这一能力与"预测下一个 token"的目标高度耦合:
- 把任务示例拼成文本序列 → 本质还是"预测下一个 token"
- Encoder-Decoder 的双向编码会"提前看到答案",反而破坏这种统一的序列建模
3.3 架构更简单:没有交叉注意力
- Decoder-only 是单栈结构:只有自注意力 + FFN,没有编码器、没有交叉注意力
- 工程上:实现更简单、训练更稳定、显存占用更低
- 推理上:只需维护一份 KV Cache;Encoder-Decoder 要同时维护编码器输出和交叉注意力的缓存,显存和时间成本更高
3.4 推理效率:KV Cache 的优势
自回归生成时,Decoder-only 每生成一个 token 只需把新的 K/V 追加到缓存;而 Encoder-Decoder 每个 token 都要与全部编码器输出做交叉注意力计算——长序列生成场景下开销显著更大。这也是为什么主流推理引擎(vLLM、TensorRT-LLM)的优化都围绕 Decoder-only 展开。
3.5 规模化(Scaling)更顺畅
- Decoder-only 把全部参数都投入到序列建模,而 Encoder-Decoder 需要把参数分配给编码器和解码器两份
- 同等参数量下,Decoder-only 的"有效建模能力"更集中;同等算力下训练吞吐更高(没有编码器前向)
- 大模型最关键的涌现能力(推理、代码、数学)几乎都出现在 Decoder-only 模型上,且 scaling law 更稳定
3.6 对齐(Alignment)流程统一
SFT、RLHF、DPO 等对齐技术都是围绕"生成式对话"设计的:输入 prompt → 模型生成回复。Decoder-only 的因果结构天然适配这种范式,而 Encoder-Decoder 需要额外的架构适配。
4. 事实核查:主流模型确实全是 Decoder-only
| 模型 | 架构 | 依据 |
|---|---|---|
| GPT 系列(OpenAI) | Decoder-only | GPT-3 论文(2020) |
| LLaMA(Meta) | Decoder-only | LLaMA 论文(2023):“We train our models on trillions of tokens…” 采用标准 Transformer decoder |
| DeepSeek-V3 | Decoder-only MoE(671B 总参/37B 激活) | DeepSeek-V3 技术报告(2024) |
| Qwen2 系列(阿里) | Decoder-only(dense + MoE) | Qwen2 技术报告(2024) |
| Mistral、Gemma、Phi | Decoder-only | 官方技术报告 |
国内大模型同样全面收敛到 Decoder-only:DeepSeek、Qwen、GLM、Kimi、通义千问等均采用此架构——这也是全球大模型社区在实证比较后形成的共识。
一个常见的"例外"是 Google Gemini 系列。但 Gemini 本质上是以 Decoder-only 为底座的混合架构(而非 T5 式的经典 Encoder-Decoder),其"编码器"部分更多服务于多模态输入理解,生成仍由因果解码器完成——恰恰说明 Decoder-only 在文本生成上的主导地位。
5. Encoder-Decoder 还有用吗?
Decoder-only 胜出不代表 Encoder-Decoder 被淘汰:
| 场景 | 为什么 Encoder-Decoder 仍有优势 |
|---|---|
| 翻译 | 交叉注意力让解码器能精确"对齐"源句位置,T5/机器翻译模型仍常用 |
| 摘要 | 双向编码能充分理解整篇源文档(BERT 式理解 + 生成) |
| 语音/多模态 | 编码器天然适合处理非文本输入(音频、图像),如 Whisper |
| 小模型场景 | 数据量小时,双向编码的学习效率更高(BERT 时代已验证) |
但在通用大模型(追求零样本、上下文学习、涌现能力、规模化)这条赛道上,Decoder-only 已经用实验证明了自己——这也解释了为什么 GPT、LLaMA、DeepSeek、Qwen 不约而同地选择了它。
6. 总结
- 目标一致性:预训练与推理都是"预测下一个 token",训练即用
- 实证结论:arXiv:2204.05832 证明 causal decoder-only 零样本泛化最强
- 能力涌现:上下文学习、推理、代码能力在 Decoder-only 上集中涌现
- 工程红利:无交叉注意力、KV Cache 友好、训练简单、缩放顺畅
- 对齐统一:SFT/RLHF 与因果生成范式天然契合
- 生态共识:国内外主流模型(GPT/LLaMA/DeepSeek/Qwen)全部收敛至此
一句话:Decoder-only 不是"最聪明的架构",而是"最通用的架构"——它把预训练、推理、对齐、规模化全链路统一到了同一个目标上,而大模型时代要的恰恰是这种极致的简单与统一。
参考
- Wang et al., What Language Model Architecture and Pretraining Objective Work Best for Zero-Shot Generalization?, 2022, arXiv:2204.05832
- Brown et al., Language Models are Few-Shot Learners (GPT-3), 2020, arXiv:2005.14165
- Raffel et al., Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (T5), 2020, arXiv:1910.10683
- Touvron et al., LLaMA: Open and Efficient Foundation Language Models, 2023, arXiv:2302.13971
- DeepSeek-AI, DeepSeek-V3 Technical Report, 2024, arXiv:2412.19437
- Qwen Team, Qwen2 Technical Report, 2024, arXiv:2407.10671
- Hugging Face, Transformer-based Encoder-Decoder Models 官方博客
更多推荐
所有评论(0)