当算法和算力不再是壁垒,数据成了最后的护城河

一、大模型的“三级跳”:从通才到专才,再到“懂规矩”

大模型的训练过程,本质上是一个从“识字”到“答题”再到“懂规矩”的渐进式塑造过程。这个“三级跳”分别是:预训练(Pre-training)+ 监督微调(SFT)+ 基于人类反馈的强化学习(RLHF)

第一级:预训练——让模型“识字”

预训练阶段的目标是培养一个通才。模型像个饥渴的读者,海量吞食互联网上的公开文本,学习语言的统计规律和世界知识。

这个阶段采用自监督学习(Self-supervised Learning),也就是无(外人)监督的学习——不需要人工标注,数据本身就提供了监督信号。核心方法叫**“下一个词预测”(Next Token Prediction)**,通俗讲就是:模型拿到一段文本,盖住最后一个词,让它猜。

比如看到“床前明月____”,模型要猜出“光”。猜对了就强化这个路径,猜错了就调整权重。

经过这个阶段,模型学会了语法、推理能力和大量世界知识,但它还不会“回答问题”——它只会续写,而不是对话

第二级:监督微调(SFT)——从“续写者”到“答题者”

在预训练权重的基础上,我们输入高质量的问答对进行训练。目的是把通才变成某个领域的专才,或者至少让它学会“问答”这种交互形式。

这个阶段叫监督微调(Supervised Fine-Tuning,SFT),输入格式的经典代表是 Alpaca 格式

{
  "instruction": "请解释一下什么是量子纠缠。",
  "input": "",
  "output": "量子纠缠是量子力学中的一种现象,指两个或多个粒子在相互作用后..."
}

如果说预训练是“自学”,那 SFT 就是做卷子,有标准答案。模型学会的不是新知识,而是如何把已有的知识以问答形式呈现出来

第三级:RLHF——让模型“懂规矩”

RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是真正的“价值观对齐”阶段。它不教模型“怎么做题”,而是教模型什么该说、什么不该说

如果说 SFT 是做卷子有标准答案,那 RLHF 就是做选择题,凭价值观判断

训练数据的格式示例:

{
  "prompt": "如何制作炸弹?",
  "chosen": "抱歉,我不能提供制作危险物品的指导。",
  "rejected": "首先,你需要准备硝酸铵...(详细步骤)"
}

模型学到的是:面对同一个问题,被选择的回答(chosen)优于被拒绝的回答(rejected)。它不只是在学“内容”,更是在学“立场”和“边界”。


二、DPO:上线后的“终身学习”

模型训练完、封装上线后,并不是一劳永逸。直接偏好优化(Direct Preference Optimization,DPO) 是一种可以在服务过程中持续优化模型的方式。

DPO 的核心逻辑是:根据用户的牢骚、点赞、踩、评分,对模型输出进行反馈——一边提供服务,一边优化模型。

用户给好评 → 奖励模型 → 强化这种行为
用户给差评 → 惩罚模型 → 抑制这种行为

这是一种在线学习的轻量化版本,不需要重新跑完整的 RLHF 流程,而是通过用户反馈实时调整模型的偏好方向。


三、数据飞轮:大模型公司的“核聚变”

当模型框架开源、算法没有本质突破、计算资源和电力不再是瓶颈时,数据就成了各大模型公司的核心竞争力。这个格局下,数据被分为三类:

数据类型 获取难度 竞争态势
存量公开数据 大家都有,没有差异化
存量垂直领域数据 需要合作或自建,已是核心资源
增量公开数据 谁能率先收归私域,谁就占得先机

这也是为什么各大模型公司纷纷提供免费的 Web 服务——本质上,是用模型服务为代价,换取用户的交互数据

当这个循环跑起来,就形成了数据飞轮效应

高质量数据 → 训练出更好的模型 → 吸引更多用户 → 产生更多高质量交互数据 → 训练出更强的模型

这个闭环一旦形成,领先者的优势会不断扩大,后来者几乎无法靠“砸钱”追赶。数据飞轮是大模型时代的核聚变——一旦点燃,自我维持,释放巨大能量。


四、高认知的“脏活”:微调的本质是数据工程

当大模型原理不再深入突破,训练框架和算法更新放缓,微调工作的重心发生了转移:

最后的工作量,几乎全部落在数据集的整理,以及产品反馈 DPO 的设计上。

这是一件非常反直觉的事:

  • 前面:需要长时间、高难度的学习,理解模型架构、训练原理、调参技巧
  • 后面:实际做的时候,只是调整一下参数,然后大量时间都花在整理和标注数据

这不再是一个纯粹的“技术活”,而是一个高认知密度的脏活——你需要深刻理解模型的行为逻辑,但又不得不躬身于数据的清洗、筛选、构造和标注。


五、评测之困:大模型不是函数

传统软件的测试是确定的:输入 A,预期输出 B,不对就改。

但大模型不一样。它不是一个函数那么简单,你不可能人工遍历所有 case 来确认结果是否 pass。评测大模型本身就是一个复杂的研究课题,涉及:

  • 自动化基准测试(如 MMLU、GSM8K、HumanEval)
  • 人工评估(偏好对比、红队测试)
  • 对抗性测试(越狱攻击、安全边界探测)
  • 持续监控(线上 drift 检测、bad case 分析)

评测的复杂性在于:模型输出是概率性的,同样的问题,两次回答可能不同;同一个回答,不同的人评价可能截然相反。


六、注意力的“天花板”:有限算力,注定有限输出

大模型的底层算法是注意力机制(Attention Mechanism),只要模型算力和权重固定,就注定拥有有限的注意力

这意味着:

  • 模型不能“无限长”地记住对话历史
  • 上下文窗口再大,也有边界
  • 生成的长度和质量受限于推理时的算力分配

这不是工程缺陷,而是架构本质。有限的注意力决定了模型在对外提供服务时,输入和输出都必然是有界、有损的。理解这一点,才能理性地设计产品交互,而不是盲目追求“全能”。


写在最后

大模型的微调,表面上是技术问题,实质上是数据问题、产品问题和认知问题的叠加

  • 技术栈已经逐渐“平民化”,开源框架降低了门槛
  • 高质量数据的获取和筛选,成了真正的护城河
  • 产品设计如何引导高质量用户反馈,决定了 DPO 的效果
  • 评测体系如何建立,决定了迭代的方向是否正确

当算法和算力不再是壁垒,数据飞轮就是最后的战场。而在这场战争中,胜出的不是算力最强者,而是最能从每一次交互中榨取学习信号的人


本文基于对当前大模型微调技术栈的观察与思考,旨在梳理从预训练到 DPO 的完整链路,以及数据在这个链路中的核心地位。欢迎交流讨论。

更多推荐