一个看似简单的任务,如何产生了惊人的智能


开篇:一个让人困惑的事实

你有没有觉得奇怪?

ChatGPT 能写诗、能编程、能解数学题、能分析法律条文——它似乎什么都会。

但如果我告诉你,它在训练时只学了一件事:

给定前面的文字,猜下一个字是什么。

就这么简单。没有人教它语法,没有人教它逻辑,没有人给它灌输知识库。

它只是在玩一个「填空游戏」——然后,智能就涌现了。

这合理吗?为什么「预测下一个词」这么简单的任务,能产生如此强大的能力?

今天,让我们一起来揭开这个谜团。

阅读本文需要的前置知识:无。只要你对 AI 感兴趣,就能读懂。


第一部分:什么是「预测下一个 token」?

先说说什么是 token

在聊「预测」之前,我们得先搞清楚:什么是 token?

token 不是「词」,而是「文本的最小处理单位」。

举个例子,这句话:

我喜欢吃苹果

可能被切成这样的 token:

["我", "喜欢", "吃", "苹果"]

或者更细:

["我", "喜", "欢", "吃", "苹", "果"]

英文也一样,“unhappiness” 可能被切成:

["un", "happiness"]  或  ["un", "happ", "iness"]

🎯 如果是你,你会怎样解释?

想象你在玩拼图。

整张图(一段文本)被切成很多小块(token)。每一小块不一定是完整的图案,但拼在一起就是完整的画面。

token 就是 LLM 眼中的「拼图碎片」。


预测下一个 token:一个填空游戏

LLM 的训练过程,本质上就是在玩填空:

输入:今天天气真
目标:好

输入:我爱北
目标:京

输入:1 + 1 =
目标:2

模型会看到海量的文本,然后不断猜:「下一个 token 是什么?」

猜对了,奖励。猜错了,调整。

重复几万亿次。

就这样。


第二部分:为什么这么简单的任务能产生智能?

这是最反直觉的地方。让我们慢慢拆解。

类比:学下棋 vs 学规则

想象两种学国际象棋的方式:

方式 A:有人教你规则

  • • 「马走日,象走田」
  • • 「开局要控制中心」
  • • 「残局王要积极」

方式 B:没人教你规则,但你看了 100 万盘棋谱

  • • 你观察每一步棋是怎么走的
  • • 你发现马总是走「日」字形
  • • 你发现开局时棋子总是往中间走

方式 B 没有人「教」你规则,但通过大量观察,你自己发现了规则。

LLM 就是方式 B。

它没有被教「主语+谓语+宾语」,但它看了太多句子,发现「我吃___」后面大概率是食物,不太可能是「飞机」。

预测下一个词,需要理解世界

这是关键洞见。让我们看几个例子:

例1:物理知识

「水烧到 100 度会___」

要答对,模型必须知道:水在标准气压下 100°C 会沸腾。

例2:因果推理和情感理解

「小明把花瓶打碎了,妈妈很___」

要答对,模型必须理解:
- 打碎东西 → 负面事件
- 妈妈对孩子闯祸 → 通常生气

例3:领域知识和语境理解

「用户问:如何排序数组?
 程序员答:你可以用___」

要答对,模型必须知道:
- 这是编程问题
- 排序算法有哪些
- 哪些答案在这个语境下合理

🖼️ 一图胜千言

【预测下一个词需要什么?】

    「法国的首都是___」
            │
            ▼
    ┌───────────────────┐
    │   要答对这道题     │
    │   模型必须「知道」  │
    └───────────────────┘
            │
   ┌────────┼────────┐
   ▼        ▼        ▼
┌─────┐  ┌─────┐  ┌─────┐
│地理  │  │语言  │  │常识  │
│知识  │  │语法  │  │推理  │
└─────┘  └─────┘  └─────┘
   │        │        │
   └────────┴────────┘
            │
            ▼
      「巴黎」✓

预测越准 → 需要的知识越多 → 模型越「聪明」

核心洞见:压缩即理解

这里有一个深刻的观点,来自信息论:

要很好地预测下一个词,你必须理解语言背后的世界。

或者换个说法:

压缩数据的过程,就是提取规律的过程。

如果模型只是死记硬背每句话,它需要存储整个互联网的文本——太大了,装不下。

但如果它能提取规律——语法规则、常识、因果关系、领域知识——它就能用更小的空间,预测更多的文本。

这就是为什么「预测下一个词」能产生智能:

要成为一个好的预测器,你必须成为一个好的世界模型。


第三部分:规模的魔法——涌现

量变产生质变

你可能会问:如果道理这么简单,为什么早期的语言模型(比如 n-gram)不行?

答案是:规模不够。

让我们看一个对比:

模型参数量能力
n-gram (1990s)几百万只能补全常见短语
LSTM (2010s)几千万能写简单句子,但经常跑题
GPT-2 (2019)15 亿能写连贯段落,但逻辑有漏洞
GPT-3 (2020)1750 亿突然会做算术、翻译、写代码
GPT-4 (2023)~1 万亿?能通过律师考试、医学考试

注意 GPT-3 那一行——「突然会做算术」。

这就是所谓的涌现(Emergence):

当模型规模跨过某个阈值,它会突然获得之前没有的能力。

没有人专门训练 GPT-3 做算术。它只是在预测下一个 token 的过程中,看了太多数学文本,然后——

「1 + 1 = 」后面大概率是「2」。

「235 + 789 = 」后面大概率是「1024」。

它学会了。


📖 设计背后的故事

2020 年,OpenAI 发表了一篇论文《Scaling Laws for Neural Language Models》。

他们发现了一个惊人的规律:

模型的性能与三个因素呈幂律关系:参数量、数据量、计算量。

只要你不断加大这三个数字,模型就会不断变强,而且——暂时看不到天花板。

这篇论文改变了整个行业的思路:

与其设计更精巧的架构,不如「暴力堆规模」。

GPT-3、GPT-4、Claude 都是这条路线的产物。


为什么是 token 而不是字符或词?

你可能好奇:为什么不直接预测「下一个字符」或「下一个词」?

让我们对比一下:

【字符级】预测下一个字符

  • • 优点:词表小(英文只有几十个字符)
  • • 缺点:序列太长(一篇文章可能有几万个字符),长距离依赖难以建模

【词级】预测下一个词

  • • 优点:序列短
  • • 缺点:词表太大(英文可能有几十万个词),罕见词、新词无法处理

【token 级】预测下一个 token(子词)

  • • 优点:词表适中(通常 3-10 万),能平衡序列长度和词表大小,能处理任何新词(拆成已知的子词)
  • • 缺点:需要设计分词算法(BPE、WordPiece 等)

token 是一个工程上的折中:既不太细,也不太粗,刚刚好。


第四部分:这种方法的局限与反思

局限 1:它可能只是「统计鹦鹉」

有一种批评声音认为:

LLM 只是在做高级的「鹦鹉学舌」,它并不真正「理解」任何东西。

这个批评有一定道理。比如:

问:一个猎人带着一只狼、一只羊和一捆草过河,
    船太小,每次只能带一样东西。
    怎样才能安全过河?

传统答案:先带羊过去,再回来带狼...(经典解法)

但如果你稍微改一下题目:

问:一个猎人带着一只狼和一捆草过河...
    (没有羊!)

很多 LLM 还是会给你那套「先带羊过去」的答案。

它在「模式匹配」,而不是「逻辑推理」。

局限 2:预测下一个词 ≠ 有用的回答

预测下一个词的目标是「像人类写的文本」,但这不等于「正确」或「有帮助」。

人类写的文本里有:

  • • 谣言和错误信息
  • • 偏见和歧视
  • • 无意义的废话

如果只是预测下一个词,模型可能会很流利地「一本正经地胡说八道」。

这就是为什么现代 LLM 需要额外的步骤:

  • • RLHF(基于人类反馈的强化学习)
  • • Constitutional AI(AI)
  • • **对齐(Alignment)**训练

让模型不仅「像人类写的」,还要「有帮助、无害、诚实」。

有没有其他方法?

「预测下一个 token」不是训练 AI 的唯一方法。学术界也在探索其他路线:

方法思路代表工作
对比学习学习区分「相似」和「不同」CLIP, SimCLR
扩散模型学习从噪声中恢复信号Stable Diffusion
世界模型学习预测环境的状态变化Dreamer, JEPA
程序合成学习生成可执行的代码AlphaCode

但目前为止,「预测下一个 token」仍然是最成功的路线之一。

原因可能是:语言是人类知识最密集的载体。把语言学好,相当于把人类的知识学了一遍。


结语:简单规则,涌现复杂

让我们回顾一下今天的核心观点:

  1. 1. LLM 的训练目标很简单:给定前文,预测下一个 token
  2. 2. 为什么有效:要准确预测,必须理解语法、语义、常识、逻辑、领域知识
  3. 3. 规模带来质变:当参数量、数据量、计算量足够大,智能会「涌现」
  4. 4. 但它不完美:可能是「统计鹦鹉」,可能「胡说八道」,需要对齐训练

💡 延伸思考

  1. 1. 如果我们用「预测下一帧视频」来训练 AI,它会不会学到物理规律?
  2. 2. 人类婴儿是怎么学习的?是「预测下一刻」吗?
  3. 3. 「能很好地预测语言」和「真正理解语言」之间,有本质区别吗?

最后,送你一句话:

「预测下一个词」听起来是世界上最无聊的任务。
但如果你要在所有话题上都预测得很准,你就必须成为一个博学的智者。

这就是 LLM 的秘密。


延伸阅读:

  • • Ilya Sutskever 的演讲「An Observation on Generalization」
  • • OpenAI 论文《Scaling Laws for Neural Language Models》
  • • Yann LeCun 关于 JEPA 的讨论

有问题欢迎留言讨论!

更多推荐