在这里插入图片描述
训练 ChatGPT 这类大模型,到底经历了什么?这篇文章把 OpenAI 训练 GPT 的过程拆成三件很容易理解的事:预训练让模型读遍互联网学会接话,SFT 请人写标准答案教它回答问题,RLHF 再用人类打分让它学会看人眼色。同时补齐数据清洗、评估和安全测试这些容易被忽略的环节,让你明白为什么数据和工程才是真正拉开差距的地方。读完你会发现,大模型不是突然变聪明的,而是被一遍遍磨出来的。

先说结论:训练一个大模型,没你想的那么玄

很多人以为 OpenAI 的模型是某种黑盒魔法,其实拆开看,很像培养一个会聊天的助手:先让它读足够多的书,学会“接话”;再手把手教它怎么回答问题;最后告诉它哪些话能说、哪些话别说。真正难的不是原理,而是每个环节背后的数据和工程。
这篇文章不打算堆术语,我尽量用大白话把 OpenAI 训 GPT 这件事讲清楚。

第一步:预训练,让模型读遍互联网

这一步英文叫 pretraining,你可以理解成“给模型打底子”。

OpenAI 会抓取海量公开文本——网页、书籍、论文、代码、论坛帖子,加起来是以 TB、PB 为单位算的。训练方式很像玩“词语接龙”:给模型前一半句子,让它猜下一个字是什么。比如给它“今天天气真”,它猜“好”,就得分;猜成“坏蛋”,就被扣分,模型内部那些可调整的参数也会跟着一起修正。
这个接龙游戏玩上几十亿次之后,模型就像小孩看多了、听多了,慢慢自己摸清了语法、常识、逻辑,甚至开始有了一点推理能力。GPT-3 用的就是这一套,论文里那个“自回归语言模型”,说白了就是“一个词一个词往后接”的意思。
这个阶段的几个关键点:

  • 数据量要足够大,大到一个小团队根本清洗不过来;
  • 数据质量比数量更影响最终效果,OpenAI 在过滤低质内容上下了很多功夫;
  • 训练很烧钱,GPT-3 级别的一次训练成本是百万美元起步。

这一阶段产出的模型叫 base model,它其实不怎么会聊天,只会续写。你跟它说话,它可能反过来把你没说完的句子补下去。所以光有预训练还不够。

第二步:SFT,教它“聊天”而不是“续写”

GPT 刚出来那会儿,很多人应该记得,你问它一个问题,它可能给你列一堆相关问题的答案,或者干脆把你问题复述一遍。因为它本质上是在续写,不是在对答。

OpenAI 的做法是请一批人先当“老师”,把各种问题的最佳答案提前写出来,然后让模型照着学。这步叫监督微调,英文 supervised fine-tuning,缩写 SFT。
做法是雇一批人来写“标准答案”——给一个指令,人写一个理想的回复。比如:

  • 指令:“把这段话翻译成英文”
  • 期望输出:一段正确翻译

然后用这些高质量的“指令-回复”对去继续训练 base model。数据不用特别大,几万条就能让模型的行为发生很大变化:它开始明白“哦,用户是在问我问题,我应该回答”。

这也就是 InstructGPT 做的事情。你会发现从那之后,GPT 的模型渐渐从“话痨续写机”变成了“有问有答的助手”。

第三步:RLHF,让它学会“看人眼色”

光会回答还不够。同一个问题,可以有十种答法,哪个好?这就涉及偏好了。

OpenAI 用的是强化学习加人类反馈,缩写 RLHF。这个名字看着唬人,拆开讲就是:

  1. 先让模型对同一个问题生成好几个回答;
  2. 让标注人员给这些回答排个序,哪个更好、哪个更差;
  3. 用这些排序数据训练一个“奖励模型”,它负责打分;
  4. 再用这个奖励模型去训练主模型,让主模型越来越往高分方向走。

中间用到的算法叫 PPO,是强化学习里比较经典的一种。你不需要懂细节,只要知道:模型在追求“被人类评高分”这件事上越走越远,慢慢地就会变得更礼貌、更听话、更少胡说。

这也是 ChatGPT 发布后体感差异那么大的原因。InstructGPT 时期的模型有些版本还很生硬,RLHF 之后明显“会做人”了。

数据:比算法更值钱的部分

OpenAI 很少公开他们具体用了什么数据,但有几件事是行业里基本公认的:

  • 预训练阶段依赖大规模公开数据,清洗和去重是重头戏;
  • SFT 和 RLHF 阶段依赖大量人工标注,早期是外包团队在写题、排序;
  • 到 GPT-4 之后,自动化和模型辅助标注的比例明显提高,不可能全靠人力。

所以别再看那种“算法才是核心壁垒”的说法了。训练管道、数据质量、评估体系,这些看起来没那么酷的东西,才是真正拉开差距的地方。

评估:怎么知道模型变“好”了

OpenAI 内部有一套挺完整的评估体系,常见的有:

  • 自动化指标,比如检查模型猜下一个词时有多“犹豫”(学术上叫困惑度),越犹豫说明越没底;
  • 学术基准测试,像 MMLU、HellaSwag、代码能力测试这一大堆,相当于给模型出一套考卷;
  • 人工评测,把人拉来对比两个模型的回答谁更好;
  • 红队测试,专门找人来“刁难”模型,看它会不会乱说、瞎编或者被套出话来。GPT-4 的技术报告里还特意提到,他们花了很多时间在安全性评估上。模型能力越强,评估和风控就越不能省。

最后的流程串联一下

把上面的东西串起来,一次完整的 GPT 训练大概是这么个顺序:

大规模文本
→ 预训练 
→ base model 
→ SFT 
→ RLHF 
→ 可对话模型 
→ 评估与安全测试 
→ 上线

每一步都在做减法:先是海量数据打底,再用少量高质量数据塑形,最后用人类偏好慢慢收口。听着不神秘,做起来每一步都挺折磨人。

普通人能带走什么

如果你也在搞模型,或者单纯想理解 OpenAI 的路线,这几个判断可能有用:

  • 预训练决定模型上限,数据质量决定你离这个上限有多近;
  • SFT 让模型变成“产品”,RLHF 让模型变得“好用”;
  • 不要只盯着模型架构,数据和评估同样是核心竞争力;
  • 大模型训练是系统工程,GPU 只是其中一环,不是全部。

OpenAI 这一路下来,真正厉害的地方在于把一套复杂的流程跑顺了,并且愿意花大力气在那些看起来“不性感”的细节上。说到底,模型不是突然变聪明的,是被人一遍遍磨出来的。

更多推荐