为什么主流大模型都是 Decoder-only?从 BERT/T5 到 GPT 的架构演进

参考:Wang et al. 2022 (arXiv:2204.05832)、GPT-3 (arXiv:2005.14165)、T5 (arXiv:1910.10683)、LLaMA (arXiv:2302.13971)、DeepSeek-V3 (arXiv:2412.19437)、Qwen2 (arXiv:2407.10671)、Hugging Face 官方博客


1. 三种 Transformer 架构:一张图看懂

Transformer 架构自 2017 年提出后演化出三条分支,核心区别在于注意力掩码——谁能"看到"谁:

Decoder-only
(GPT 系)

因果注意力
每个 token 只能看到左侧

代表作:GPT、LLaMA
DeepSeek、Qwen

Encoder-Decoder
(T5/BART 系)

编码器双向 + 解码器因果
交叉注意力连接两端

代表作:T5、BART
擅长:翻译/摘要

Encoder-only
(BERT 系)

双向注意力
每个 token 看到全部上下文

代表作:BERT
擅长:理解/分类

架构注意力模式代表模型预训练目标
Encoder-only双向(bidirectional)BERT、RoBERTa、DeBERTa掩码语言建模(MLM)
Encoder-Decoder双向编码 + 因果解码 + 交叉注意力T5、BART、Pegasus去噪自编码(span corruption)
Decoder-only纯因果(causal)GPT、LLaMA、DeepSeek、Qwen、Mistral自回归语言建模(AR LM)

2018–2021 年还是"三足鼎立":BERT 统治理解任务、T5/BART 统治生成任务、GPT 只是"第三条路"。到 2023 年之后,所有主流大模型几乎都收敛到了 Decoder-only——为什么?


2. 决定性证据:一篇论文终结了争论

2022 年,Google 与 CMU 发表了关键论文 《What Language Model Architecture and Pretraining Objective Work Best for Zero-Shot Generalization?》(arXiv:2204.05832),用 50 亿参数模型、1700 亿 token 做了大规模系统对比,结论明确:

causal decoder-only 模型 + 自回归语言建模目标,在纯无监督预训练后展现出最强的零样本泛化能力。

论文对比了三种架构(causal decoder-only / non-causal decoder-only / encoder-decoder)× 两种目标(自回归 / 掩码语言建模),这是第一次在同等规模下公平回答"哪种架构最好",也为此后大模型的架构选择提供了实验依据。

注意结论的另一半:如果先做多任务提示微调(multitask finetuning),非因果(双向)模型反而更强——这说明 Decoder-only 的优势主要体现在预训练后的通用能力上,而这正是大模型范式的核心。


3. 为什么 Decoder-only 胜出:六大原因

3.1 预训练与推理目标完全一致(最重要)

  • Decoder-only:预训练就是"预测下一个 token",推理(生成)也是"预测下一个 token"——目标天然对齐,训练时学到的能力在推理时原样发挥
  • Encoder-Decoder:预训练用去噪目标(T5 的 span corruption、BART 的文本填充),推理却是自回归生成——训练与推理存在目标偏差,模型需要在"补全"和"生成"之间切换

用最简单的类比:Decoder-only 像"从小到大一直在写作文的人",Encoder-Decoder 像"平时练填空题、考试却要写作文"。

3.2 涌现的 In-Context Learning(上下文学习)

GPT-3 论文(2020)发现:纯因果语言模型在参数量增大到一定程度后,涌现出上下文学习能力——不需要微调,给几个示例(few-shot)就能完成任务。这一能力与"预测下一个 token"的目标高度耦合:

  • 把任务示例拼成文本序列 → 本质还是"预测下一个 token"
  • Encoder-Decoder 的双向编码会"提前看到答案",反而破坏这种统一的序列建模

3.3 架构更简单:没有交叉注意力

  • Decoder-only 是单栈结构:只有自注意力 + FFN,没有编码器、没有交叉注意力
  • 工程上:实现更简单、训练更稳定、显存占用更低
  • 推理上:只需维护一份 KV Cache;Encoder-Decoder 要同时维护编码器输出和交叉注意力的缓存,显存和时间成本更高

3.4 推理效率:KV Cache 的优势

自回归生成时,Decoder-only 每生成一个 token 只需把新的 K/V 追加到缓存;而 Encoder-Decoder 每个 token 都要与全部编码器输出做交叉注意力计算——长序列生成场景下开销显著更大。这也是为什么主流推理引擎(vLLM、TensorRT-LLM)的优化都围绕 Decoder-only 展开。

3.5 规模化(Scaling)更顺畅

  • Decoder-only 把全部参数都投入到序列建模,而 Encoder-Decoder 需要把参数分配给编码器和解码器两份
  • 同等参数量下,Decoder-only 的"有效建模能力"更集中;同等算力下训练吞吐更高(没有编码器前向)
  • 大模型最关键的涌现能力(推理、代码、数学)几乎都出现在 Decoder-only 模型上,且 scaling law 更稳定

3.6 对齐(Alignment)流程统一

SFT、RLHF、DPO 等对齐技术都是围绕"生成式对话"设计的:输入 prompt → 模型生成回复。Decoder-only 的因果结构天然适配这种范式,而 Encoder-Decoder 需要额外的架构适配。


4. 事实核查:主流模型确实全是 Decoder-only

模型架构依据
GPT 系列(OpenAI)Decoder-onlyGPT-3 论文(2020)
LLaMA(Meta)Decoder-onlyLLaMA 论文(2023):“We train our models on trillions of tokens…” 采用标准 Transformer decoder
DeepSeek-V3Decoder-only MoE(671B 总参/37B 激活)DeepSeek-V3 技术报告(2024)
Qwen2 系列(阿里)Decoder-only(dense + MoE)Qwen2 技术报告(2024)
Mistral、Gemma、PhiDecoder-only官方技术报告

国内大模型同样全面收敛到 Decoder-only:DeepSeek、Qwen、GLM、Kimi、通义千问等均采用此架构——这也是全球大模型社区在实证比较后形成的共识。

一个常见的"例外"是 Google Gemini 系列。但 Gemini 本质上是以 Decoder-only 为底座的混合架构(而非 T5 式的经典 Encoder-Decoder),其"编码器"部分更多服务于多模态输入理解,生成仍由因果解码器完成——恰恰说明 Decoder-only 在文本生成上的主导地位。


5. Encoder-Decoder 还有用吗?

Decoder-only 胜出不代表 Encoder-Decoder 被淘汰:

场景为什么 Encoder-Decoder 仍有优势
翻译交叉注意力让解码器能精确"对齐"源句位置,T5/机器翻译模型仍常用
摘要双向编码能充分理解整篇源文档(BERT 式理解 + 生成)
语音/多模态编码器天然适合处理非文本输入(音频、图像),如 Whisper
小模型场景数据量小时,双向编码的学习效率更高(BERT 时代已验证)

但在通用大模型(追求零样本、上下文学习、涌现能力、规模化)这条赛道上,Decoder-only 已经用实验证明了自己——这也解释了为什么 GPT、LLaMA、DeepSeek、Qwen 不约而同地选择了它。


6. 总结

2018-2021
三足鼎立

2022
论文实证:
Decoder-only 零样本最强

2023-至今
GPT/LLaMA/DeepSeek/Qwen
全面收敛 Decoder-only

  1. 目标一致性:预训练与推理都是"预测下一个 token",训练即用
  2. 实证结论:arXiv:2204.05832 证明 causal decoder-only 零样本泛化最强
  3. 能力涌现:上下文学习、推理、代码能力在 Decoder-only 上集中涌现
  4. 工程红利:无交叉注意力、KV Cache 友好、训练简单、缩放顺畅
  5. 对齐统一:SFT/RLHF 与因果生成范式天然契合
  6. 生态共识:国内外主流模型(GPT/LLaMA/DeepSeek/Qwen)全部收敛至此

一句话:Decoder-only 不是"最聪明的架构",而是"最通用的架构"——它把预训练、推理、对齐、规模化全链路统一到了同一个目标上,而大模型时代要的恰恰是这种极致的简单与统一。


参考

  1. Wang et al., What Language Model Architecture and Pretraining Objective Work Best for Zero-Shot Generalization?, 2022, arXiv:2204.05832
  2. Brown et al., Language Models are Few-Shot Learners (GPT-3), 2020, arXiv:2005.14165
  3. Raffel et al., Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (T5), 2020, arXiv:1910.10683
  4. Touvron et al., LLaMA: Open and Efficient Foundation Language Models, 2023, arXiv:2302.13971
  5. DeepSeek-AI, DeepSeek-V3 Technical Report, 2024, arXiv:2412.19437
  6. Qwen Team, Qwen2 Technical Report, 2024, arXiv:2407.10671
  7. Hugging Face, Transformer-based Encoder-Decoder Models 官方博客

更多推荐