GPT 系列的单向自回归生成:原因与能力边界

一、为什么选择单向自回归生成?

1. 架构根源:Decoder-Only Transformer

GPT 系列采用 Decoder-Only 架构,其核心约束是因果注意力掩码(Causal Mask)

注意力矩阵(下三角掩码):
     w1   w2   w3   w4
w1 [  ✓    ✗    ✗    ✗  ]
w2 [  ✓    ✓    ✗    ✗  ]
w3 [  ✓    ✓    ✓    ✗  ]
w4 [  ✓    ✓    ✓    ✓  ]

每个位置只能 attend 到自身及之前的 token,看不到"未来"

这一设计直接决定了模型只能从左到右逐词生成,即自回归(Autoregressive)

P(w1,w2,...,wT)=∏t=1TP(wt∣w1,w2,...,wt−1)P(w_1, w_2, ..., w_T) = \prod_{t=1}^{T} P(w_t \mid w_1, w_2, ..., w_{t-1})P(w1,w2,...,wT)=t=1TP(wtw1,w2,...,wt1)

2. 三个深层原因

原因一:生成任务的天然需求

文本生成本质上是一个序列决策过程——逐词产出,每一步都依赖之前已生成的内容:

输入提示: "今天天气"
  → P("真")  = 0.31
  → P("很")  = 0.25
  → P("不")  = 0.18
  ...

选 "真" → "今天天气真"
  → P("好")  = 0.45
  → P("棒")  = 0.20
  ...

选 "好" → "今天天气真好"

单向自回归与生成过程天然对齐:训练时的计算方式(从前到后预测下一个词)与推理时的生成方式(从前到后逐词产出)完全一致,不存在训练-推理不一致问题

对比 BERT 的 MLM:训练时能看到"未来"词,但生成时无法使用——BERT 无法自回归地生成文本。

原因二:概率建模的理论统一性

自回归将联合概率分解为条件概率的连乘,这是概率论中最通用的序列建模框架:

P(序列)=P(w1)⋅P(w2∣w1)⋅P(w3∣w1,w2)⋯P(wT∣w1,...,wT−1)P(\text{序列}) = P(w_1) \cdot P(w_2|w_1) \cdot P(w_3|w_1,w_2) \cdots P(w_T|w_1,...,w_{T-1})P(序列)=P(w1)P(w2w1)P(w3w1,w2)P(wTw1,...,wT1)

这种分解方式:

  • 无需任何独立性假设(不像 BERT 的 MLM 假设被遮盖词之间独立)
  • 适用于任意长度的序列
  • 可以精确计算序列的概率,用于评估文本流畅度、排序候选输出等
原因三:规模化扩展的天然适配

GPT 系列的核心信念是 “规模即一切”(Scale is all you need)。自回归框架在规模化方面有独特优势:

优势 说明
训练信号密度高 每个位置都产生预测损失,序列中 T 个 token 提供 T 个训练信号(BERT 仅 ~15%)
零样本/少样本能力涌现 同一个自回归目标可以统一所有任务——只需将任务转化为"续写"
架构简洁可扩展 单一 Decoder 堆叠,无 Encoder-Decoder 交互,扩展时只需增加层数和参数
任务统一为"续写":

翻译:   "将以下英文翻译为中文: Hello → "你好"
摘要:   "文章: ... 请总结: → "..."
问答:   "问题: ... 答案: → "..."
代码:   "def fibonacci(n): → "    if n <= 1: ..."

二、对能力边界的影响

优势:生成与涌现能力

┌─────────────────────────────────────────────────────────┐
│              GPT 自回归生成的能力优势                      │
│                                                         │
│  ✅ 开放式文本生成(续写、创意写作、对话)                 │
│  ✅ 任意长度的序列产出                                   │
│  ✅ 零样本/少样本任务泛化(GPT-3+)                       │
│  ✅ 思维链推理(Chain-of-Thought)                       │
│  ✅ 代码生成与补全                                       │
│  ✅ 多轮对话的上下文累积                                  │
└─────────────────────────────────────────────────────────┘

思维链推理是自回归架构的独特优势——模型可以将推理过程展开为中间步骤,逐步推导:

问题: "小明有3个苹果,吃了1个,又买了2个,还有几个?"

自回归生成过程:
  "小明有3个苹果"        → 记录初始状态
  "吃了1个,剩3-1=2个"   → 第一步推理
  "又买了2个,2+2=4个"   → 第二步推理
  "答案是4个"            → 最终结论

每一步推理都作为后续步骤的上下文,这种**“边生成边思考”**的能力是双向模型难以实现的。

局限:单向性带来的能力边界

局限一:无法利用"未来"上下文
填空任务: "The capital of France is 

更多推荐