看懂这个,你就懂了大模型:预测下一个 Token 的魔法
一个看似简单的任务,如何产生了惊人的智能
开篇:一个让人困惑的事实
你有没有觉得奇怪?
ChatGPT 能写诗、能编程、能解数学题、能分析法律条文——它似乎什么都会。
但如果我告诉你,它在训练时只学了一件事:
给定前面的文字,猜下一个字是什么。
就这么简单。没有人教它语法,没有人教它逻辑,没有人给它灌输知识库。
它只是在玩一个「填空游戏」——然后,智能就涌现了。
这合理吗?为什么「预测下一个词」这么简单的任务,能产生如此强大的能力?
今天,让我们一起来揭开这个谜团。
阅读本文需要的前置知识:无。只要你对 AI 感兴趣,就能读懂。
第一部分:什么是「预测下一个 token」?
先说说什么是 token
在聊「预测」之前,我们得先搞清楚:什么是 token?
token 不是「词」,而是「文本的最小处理单位」。
举个例子,这句话:
我喜欢吃苹果可能被切成这样的 token:
["我", "喜欢", "吃", "苹果"]或者更细:
["我", "喜", "欢", "吃", "苹", "果"]英文也一样,“unhappiness” 可能被切成:
["un", "happiness"] 或 ["un", "happ", "iness"]🎯 如果是你,你会怎样解释?
想象你在玩拼图。
整张图(一段文本)被切成很多小块(token)。每一小块不一定是完整的图案,但拼在一起就是完整的画面。
token 就是 LLM 眼中的「拼图碎片」。
预测下一个 token:一个填空游戏
LLM 的训练过程,本质上就是在玩填空:
输入:今天天气真
目标:好
输入:我爱北
目标:京
输入:1 + 1 =
目标:2模型会看到海量的文本,然后不断猜:「下一个 token 是什么?」
猜对了,奖励。猜错了,调整。
重复几万亿次。
就这样。
第二部分:为什么这么简单的任务能产生智能?
这是最反直觉的地方。让我们慢慢拆解。
类比:学下棋 vs 学规则
想象两种学国际象棋的方式:
方式 A:有人教你规则
- • 「马走日,象走田」
- • 「开局要控制中心」
- • 「残局王要积极」
方式 B:没人教你规则,但你看了 100 万盘棋谱
- • 你观察每一步棋是怎么走的
- • 你发现马总是走「日」字形
- • 你发现开局时棋子总是往中间走
方式 B 没有人「教」你规则,但通过大量观察,你自己发现了规则。
LLM 就是方式 B。
它没有被教「主语+谓语+宾语」,但它看了太多句子,发现「我吃___」后面大概率是食物,不太可能是「飞机」。
预测下一个词,需要理解世界
这是关键洞见。让我们看几个例子:
例1:物理知识
「水烧到 100 度会___」
要答对,模型必须知道:水在标准气压下 100°C 会沸腾。例2:因果推理和情感理解
「小明把花瓶打碎了,妈妈很___」
要答对,模型必须理解:
- 打碎东西 → 负面事件
- 妈妈对孩子闯祸 → 通常生气例3:领域知识和语境理解
「用户问:如何排序数组?
程序员答:你可以用___」
要答对,模型必须知道:
- 这是编程问题
- 排序算法有哪些
- 哪些答案在这个语境下合理🖼️ 一图胜千言
【预测下一个词需要什么?】
「法国的首都是___」
│
▼
┌───────────────────┐
│ 要答对这道题 │
│ 模型必须「知道」 │
└───────────────────┘
│
┌────────┼────────┐
▼ ▼ ▼
┌─────┐ ┌─────┐ ┌─────┐
│地理 │ │语言 │ │常识 │
│知识 │ │语法 │ │推理 │
└─────┘ └─────┘ └─────┘
│ │ │
└────────┴────────┘
│
▼
「巴黎」✓
预测越准 → 需要的知识越多 → 模型越「聪明」核心洞见:压缩即理解
这里有一个深刻的观点,来自信息论:
要很好地预测下一个词,你必须理解语言背后的世界。
或者换个说法:
压缩数据的过程,就是提取规律的过程。
如果模型只是死记硬背每句话,它需要存储整个互联网的文本——太大了,装不下。
但如果它能提取规律——语法规则、常识、因果关系、领域知识——它就能用更小的空间,预测更多的文本。
这就是为什么「预测下一个词」能产生智能:
要成为一个好的预测器,你必须成为一个好的世界模型。
第三部分:规模的魔法——涌现
量变产生质变
你可能会问:如果道理这么简单,为什么早期的语言模型(比如 n-gram)不行?
答案是:规模不够。
让我们看一个对比:
| 模型 | 参数量 | 能力 |
|---|---|---|
| n-gram (1990s) | 几百万 | 只能补全常见短语 |
| LSTM (2010s) | 几千万 | 能写简单句子,但经常跑题 |
| GPT-2 (2019) | 15 亿 | 能写连贯段落,但逻辑有漏洞 |
| GPT-3 (2020) | 1750 亿 | 突然会做算术、翻译、写代码 |
| GPT-4 (2023) | ~1 万亿? | 能通过律师考试、医学考试 |
注意 GPT-3 那一行——「突然会做算术」。
这就是所谓的涌现(Emergence):
当模型规模跨过某个阈值,它会突然获得之前没有的能力。
没有人专门训练 GPT-3 做算术。它只是在预测下一个 token 的过程中,看了太多数学文本,然后——
「1 + 1 = 」后面大概率是「2」。
「235 + 789 = 」后面大概率是「1024」。
它学会了。
📖 设计背后的故事
2020 年,OpenAI 发表了一篇论文《Scaling Laws for Neural Language Models》。
他们发现了一个惊人的规律:
模型的性能与三个因素呈幂律关系:参数量、数据量、计算量。
只要你不断加大这三个数字,模型就会不断变强,而且——暂时看不到天花板。
这篇论文改变了整个行业的思路:
与其设计更精巧的架构,不如「暴力堆规模」。
GPT-3、GPT-4、Claude 都是这条路线的产物。
为什么是 token 而不是字符或词?
你可能好奇:为什么不直接预测「下一个字符」或「下一个词」?
让我们对比一下:
【字符级】预测下一个字符
- • 优点:词表小(英文只有几十个字符)
- • 缺点:序列太长(一篇文章可能有几万个字符),长距离依赖难以建模
【词级】预测下一个词
- • 优点:序列短
- • 缺点:词表太大(英文可能有几十万个词),罕见词、新词无法处理
【token 级】预测下一个 token(子词)
- • 优点:词表适中(通常 3-10 万),能平衡序列长度和词表大小,能处理任何新词(拆成已知的子词)
- • 缺点:需要设计分词算法(BPE、WordPiece 等)
token 是一个工程上的折中:既不太细,也不太粗,刚刚好。
第四部分:这种方法的局限与反思
局限 1:它可能只是「统计鹦鹉」
有一种批评声音认为:
LLM 只是在做高级的「鹦鹉学舌」,它并不真正「理解」任何东西。
这个批评有一定道理。比如:
问:一个猎人带着一只狼、一只羊和一捆草过河,
船太小,每次只能带一样东西。
怎样才能安全过河?
传统答案:先带羊过去,再回来带狼...(经典解法)
但如果你稍微改一下题目:
问:一个猎人带着一只狼和一捆草过河...
(没有羊!)
很多 LLM 还是会给你那套「先带羊过去」的答案。它在「模式匹配」,而不是「逻辑推理」。
局限 2:预测下一个词 ≠ 有用的回答
预测下一个词的目标是「像人类写的文本」,但这不等于「正确」或「有帮助」。
人类写的文本里有:
- • 谣言和错误信息
- • 偏见和歧视
- • 无意义的废话
如果只是预测下一个词,模型可能会很流利地「一本正经地胡说八道」。
这就是为什么现代 LLM 需要额外的步骤:
- • RLHF(基于人类反馈的强化学习)
- • Constitutional AI(AI)
- • **对齐(Alignment)**训练
让模型不仅「像人类写的」,还要「有帮助、无害、诚实」。
有没有其他方法?
「预测下一个 token」不是训练 AI 的唯一方法。学术界也在探索其他路线:
| 方法 | 思路 | 代表工作 |
|---|---|---|
| 对比学习 | 学习区分「相似」和「不同」 | CLIP, SimCLR |
| 扩散模型 | 学习从噪声中恢复信号 | Stable Diffusion |
| 世界模型 | 学习预测环境的状态变化 | Dreamer, JEPA |
| 程序合成 | 学习生成可执行的代码 | AlphaCode |
但目前为止,「预测下一个 token」仍然是最成功的路线之一。
原因可能是:语言是人类知识最密集的载体。把语言学好,相当于把人类的知识学了一遍。
结语:简单规则,涌现复杂
让我们回顾一下今天的核心观点:
- 1. LLM 的训练目标很简单:给定前文,预测下一个 token
- 2. 为什么有效:要准确预测,必须理解语法、语义、常识、逻辑、领域知识
- 3. 规模带来质变:当参数量、数据量、计算量足够大,智能会「涌现」
- 4. 但它不完美:可能是「统计鹦鹉」,可能「胡说八道」,需要对齐训练
💡 延伸思考
- 1. 如果我们用「预测下一帧视频」来训练 AI,它会不会学到物理规律?
- 2. 人类婴儿是怎么学习的?是「预测下一刻」吗?
- 3. 「能很好地预测语言」和「真正理解语言」之间,有本质区别吗?
最后,送你一句话:
「预测下一个词」听起来是世界上最无聊的任务。
但如果你要在所有话题上都预测得很准,你就必须成为一个博学的智者。
这就是 LLM 的秘密。
延伸阅读:
- • Ilya Sutskever 的演讲「An Observation on Generalization」
- • OpenAI 论文《Scaling Laws for Neural Language Models》
- • Yann LeCun 关于 JEPA 的讨论
有问题欢迎留言讨论!
更多推荐
所有评论(0)