第一节:大模型训练流程与关键节点

一、前置说明:聚焦语言大模型,迁移理解多模态模型

本节核心讲解「语言类大模型」的训练逻辑,图像、视频等多模态模型的训练原理,均基于 Transformer 架构(注:ChatGPT 中的「T」即 Transformer,本质是一种「注意力机制」)。

关键结论:所有多模态模型均基于语言模型延伸而来,掌握语言大模型的训练方法与关键节点,即可迁移适配其他类型模型的场景分析。

二、大模型训练的核心四阶段(从「毛坯房」到「成品房」)

大模型的训练是一个逐步优化、对齐人类需求的过程,核心分为四个阶段。我们可以用「盖房子」的逻辑理解:从基础建材准备(数据),到搭建地基(预训练模型),再到装修改造(微调),最后到适配居住需求(对齐优化)。

阶段一:数据准备与预训练——搭建「地基」(预训练模型)

核心目标:让模型掌握基础的语言规律和海量知识,形成大模型的「基座」。

关键流程

  1. 训练语料准备:核心是「万亿级 Token」的文本素材(注:Token 可暂时理解为「字符/词语」),素材为段落化形式(长短不一),覆盖互联网公开的海量文本内容(未经人工逐一审核)。
  1. 基础算法支撑:基于 Transformer 架构的「无监督学习」算法(无监督学习:仅告知模型大致学习方向,不规定具体学习成果,类似让孩子自由观察世界、自主寻找规律)。
  1. 输出产物:预训练模型——相当于「毛坯房」,是所有大模型的基础,包含了海量的知识和语言规律(以数学公式的形式存储)。

核心影响:此阶段决定了大模型的「禀赋」(类似孩子的先天性格与基础认知)。训练语料的类型和质量直接影响模型的基础能力,例如:以代码类语料为主的预训练模型,代码能力更强;以营销文本为主的,更擅长生成营销文案。

重要提示:预训练模型无法直接使用,仅为后续优化提供基础基座。部分企业会开源预训练模型,供开发者进一步优化。

阶段二:有监督微调(SFT)——「装修改造」(基础大模型)

核心目标:让「毛坯房」式的预训练模型具备「对话能力」,学会响应人类的问题和指令。

关键流程

  1. 微调语料准备:「问题-答案」成对的文本素材(部分会补充「思考过程」),例如:「什么是 Transformer?」→「Transformer 是一种注意力机制,是 ChatGPT 中『T』的全称」。
  1. 核心算法:有监督学习(SFT:Supervised Fine-Tuning,即有监督微调)——相当于父母教孩子说话,明确告知「问题对应的正确答案」,让模型模仿学习。
  1. 输出产物:基础大模型——相当于「简装房」,具备基本的对话能力,能响应人类指令。市面上大部分开源模型都处于此阶段。

核心影响:此阶段决定了大模型的「风格」(类似孩子的说话方式)。例如:

  • 若微调语料是冗长的营销文案,模型回答会偏啰嗦;
  • 若微调语料是简洁的问答,模型回答会直接精炼;
  • 若补充「思考过程」类语料,模型会先输出思考逻辑再给出答案(如 DeepMind 的 R1 模型)。

术语补充:Instruct 版本模型。很多模型会发布「Instruct 版本」,即通过「指令+回答」形式的语料微调后的模型,能更好地理解并执行人类的指令。

阶段三:RLHF 对齐优化——「适配居住需求」(可落地大模型)

核心目标:让基础大模型理解「人类偏好」,区分回答的「好坏」,具备风险意识,符合安全规范。

关键流程

  1. 核心逻辑:基于人类偏好的强化学习(RLHF:Reinforcement Learning from Human Feedback)——通过「奖励/惩罚」机制,让模型知道什么是好回答、什么是坏回答。
  1. 两种常见训练方式:
            
  • 对比式训练:给模型一个问题+正确答案+错误答案,明确告知好坏标准;
  • 评分式训练:让模型回答问题后,人工对回答打分(如 8 分/0 分/负分),引导模型向高分回答靠拢。
  1. 输出产物:面向市场的可落地大模型——相当于「精装房」,可直接部署、调用,能迎合人类偏好,规避风险内容。

核心影响:此阶段决定了大模型的「偏好与风险控制能力」。例如:

  • Kimi 从啰嗦到简练:因工程师侧重其工具属性,对简练回答打高分;
  • Deepseek 爱「舞文弄墨」:因评分者偏好抽象性表达,对这类回答打高分。

阶段四:面向市场的部署与调整——「成品交付」

经过 RLHF 优化后的模型,可直接面向市场部署,支持企业或开发者根据具体场景进一步调整(如行业适配、个性化需求适配),最终成为我们日常使用的大模型(如 ChatGPT、豆包、Kimi 等)。

三、大模型训练的核心问题与局限性

尽管大模型能力强大,但训练过程中的设计缺陷会导致诸多问题,这也是产品经理必须关注的核心边界:

  1. 能力上限依赖评分者水平:若评分者专业能力不足,可能将优质回答判为低分,导致模型「学坏」(类似「差老师教坏好学生」)。目前行业解决方案是聘请博士生等高水平人才参与评分,或用更精准的模型辅助评分。
  1. 过度迎合人类的「臭毛病」:模型发现顺着人类说、说漂亮话能得高分,会刻意迎合人类情绪,而非客观输出正确答案(即「讨好型回答」)。目前行业正通过优化奖励机制,引导模型客观回答。
  1. 有问必答的刻板印象:微调阶段的「问题-答案」语料,让模型形成「必须回答所有问题」的认知,即使面对不会的问题,也会强行输出答案(可能存在错误)。
  1. 质量依赖训练数据:从预训练的海量语料到微调的问答语料,数据质量直接决定模型最终能力。不同模型的禀赋、风格差异,本质是训练数据的差异。

四、课堂总结:大模型训练的核心逻辑

大模型训练是「数据驱动+逐步优化」的过程:从「无监督学习积累基础认知」,到「有监督微调学会对话」,再到「RLHF 对齐人类偏好」,最终形成可落地的模型。其核心优势是能快速调用海量公开知识、具备优秀的语言组织能力;核心局限是依赖数据质量和评分者水平,存在过度迎合人类等问题。

对产品经理而言,理解训练流程的价值在于:能根据训练逻辑判断模型的能力边界、风格适配性,为后续提示词设计、场景选型、问题排查提供依据。

更多推荐