第一阶段:预训练 - 铸造模型的“世界观”

这是最耗时、耗资最巨大的阶段,目标是赋予模型通用的语言理解和世界知识。

核心框架与技术要点
  1. 模型架构:Transformer的统治

    • 核心:几乎全部基于Transformer的Decoder-only(如GPT、LLaMA)或Encoder-Decoder(如T5)架构。当前,Decoder-only是生成式大模型的主流。
    • 技术演进
      • 归一化技术:从LayerNorm发展到RMSNorm,计算更简单,效果更好。
      • 激活函数:从ReLU、GELU发展到SwiGLU/SiLU,提升模型表达能力。
      • 位置编码:从绝对位置编码(如Sinusoidal)发展到更擅长外推的旋转位置编码(RoPE),使模型能处理比训练时更长的文本。
      • 注意力机制优化:为应对长上下文带来的计算复杂度(O(n²)),引入分组查询注意力(GQA)多头潜在注意力(MLA) 等技术,在几乎不损失效果的前提下大幅降低KV Cache,提升推理速度。
  2. 训练框架:分布式训练的工程奇迹

    • 核心框架
      • Megatron-LM:NVIDIA推出,擅长张量并行,将模型层内的矩阵计算拆分到多个GPU上。
      • DeepSpeed:Microsoft推出,其ZeRO 技术擅长数据并行下的显存优化,能将优化器状态、梯度、参数分片到所有GPU上,实现超大规模模型训练。
    • 实践:通常结合使用,形成 Megatron-DeepSpeed 框架,实现混合并行
      • 数据并行:在不同GPU上处理不同批次的数据。
      • 张量/流水线并行:将单个大模型本身拆分到多个GPU上。
  3. 数据工程:质量决定天花板

    • 流程:海量原始数据 -> 去重 -> 质量过滤(基于启发式规则、模型打分) -> 隐私信息脱敏 -> 分词。
    • 技术要点
      • 分词器:主流使用Byte-Pair Encoding 及其变种(如SentencePiece),能在词汇量和序列长度间取得良好平衡。
      • 数据配比:这是核心艺术。代码数据能提升逻辑性,学术论文提升推理能力,网页数据保证多样性。不同数据源的混合比例对最终模型能力有决定性影响。
重难点与挑战
  • 难点1:巨大的算力与成本
    • 训练一个千亿级模型需要数千张GPU数月时间,成本可达数千万美元。如何提高训练效率(Tokens/Second)是首要难题。
  • 难点2:数据质量与偏见
    • 互联网数据天然包含大量噪声、错误信息和偏见。如何有效清洗和过滤,避免“垃圾进,垃圾出”,是保证模型安全性和可靠性的基石。
  • 难点3:训练的稳定性
    • 在超大规模训练中,损失尖峰 是常见问题。轻微的数值不稳定可能导致训练崩溃。需要精细的调参(学习率、热身策略、梯度裁剪)和损失监控与回退机制。
  • 难点4:可复现性与评估
    • 由于数据、超参数和随机性的巨大影响,完全复现一个SOTA模型几乎不可能。同时,在训练中期如何科学地评估模型能力(而不只是看损失),并据此调整策略,是一个开放问题。

第二阶段:监督微调 - 塑造“对话人格”

此阶段让“通才”基座模型变成“专才”助手。

核心框架与技术要点
  1. 数据构建:指令数据的艺术

    • 来源
      • 人工撰写:质量最高,但成本高昂。
      • Self-Instruct:利用基座模型自己生成种子指令,再经过筛选和人工修正。
      • 合成数据:通过更强大的模型(如GPT-4)为查询生成高质量回答。
    • 技术要点
      • 多样性:指令需覆盖各种任务类型(问答、创作、推理、总结、编码等)。
      • 复杂性:需要包含单轮、多轮对话,以及需要多步推理的复杂指令。
      • 对齐目标:数据应体现有帮助的、诚实的、无害的 行为准则。
  2. 微调方法:参数高效微调成为主流

    • LoRA:核心思想是假设模型微调时的权重更新是低秩的。通过引入两个小的可训练矩阵A和B(其乘积 ΔW = BA)来近似全参数更新。优势:大大减少可训练参数量(通常仅为原模型的0.1%~1%),训练出的Adapter可以合并回原模型,不引入推理延迟。
    • QLoRA:在LoRA基础上,将预训练权重量化为4-bit(NF4格式),并通过一种叫双量化的技术进一步压缩。在前向和反向传播时,动态地将权重反量化为BF16进行计算。优势:使得在单张24GB显存的消费级显卡上微调650亿参数的模型成为可能。
    • 全参数微调:在计算资源极度充足且数据质量非常高的情况下,全参数微调的理论性能上限仍然最高。
重难点与挑战
  • 难点1:灾难性遗忘
    • 模型在适应新任务(对话)时,可能会遗忘在预训练阶段学到的宝贵通用知识。需要通过适当的学习率混合预训练数据防止遗忘的正则化技术来缓解。
  • 难点2:数据质量与数量平衡
    • 几千条高质量的SFT数据可能比几十万条低质数据效果更好。如何设计数据配方,以最低成本达到最优效果,是核心挑战。
  • 难点3:过拟合与“鹦鹉学舌”
    • 如果SFT数据风格单一,模型可能会机械地模仿数据中的回答模式,缺乏泛化能力。需要确保数据多样性并进行严格的验证集评估。

第三阶段:人类对齐 - 学习“察言观色”

让模型的理解与人类的偏好、价值观和安全准则对齐。

核心框架与技术要点
  1. RLHF

    • 流程
      1. 奖励模型训练
        • 数据:收集人类对多个模型回答的排序数据(如A > B > C)。
        • 训练:训练一个独立的奖励模型,学习预测人类更喜欢哪个回答。通常使用** pairwise ranking loss**。
      2. 强化学习微调
        • 环境:SFT模型。
        • Agent:需要优化的策略模型。
        • 奖励:RM给出的分数 + 惩罚项
        • 算法:常用PPO。为防止策略模型偏离SFT基础太远,会加入KL散度惩罚。
    • 技术要点:PPO的实现非常复杂,需要精细的超参数 tuning 和多个模型(策略模型、参考模型、奖励模型)的协同训练。
  2. DPO

    • 核心思想:一种无奖励模型的替代方案。它通过一个巧妙的数学推导,将偏好学习问题转化为一个直接的有监督损失函数。
    • 流程:直接使用偏好数据(赢家回答 vs 输家回答),通过一个闭式解来优化策略模型,使其增加生成赢家回答的概率,降低生成输家回答的概率。
    • 优势大大简化了训练流程,更稳定,计算成本更低,已成为RLHF的强大竞争对手。
重难点与挑战
  • 难点1:“对齐税”
    • 对齐过程可能会轻微降低模型在某些通用任务(如代码生成、数学推理)上的能力,这种现象被称为“对齐税”。需要在帮助性和无害性之间做出权衡。
  • 难点2:奖励模型的“胡言乱语”
    • RM本身也是一个语言模型,它可能无法真正理解人类的复杂价值观,或者对某些“胡说八道”但看起来流畅的回答给出高分。RM的质量直接决定了RLHF的上限。
  • 难点3:泛化性与“越狱”
    • 对齐是在有限数据上进行的,模型可能学会在训练过的情境下表现良好,但对新的、恶意的提示(越狱攻击)缺乏鲁棒性。这是一个持续的安全攻防战。

第四阶段:推理与应用 - 从实验室到生产

核心框架与技术要点
  1. 推理加速

    • 量化
      • 训练后量化:最简单,但可能损失精度。
      • 量化感知训练:在训练/微调时模拟量化过程,获得更好的低精度模型。
      • AWQ/GPTQ:主流的高级PTQ方法,能更好地保护权重中对模型性能至关重要的“突出权重”。
    • 推理框架
      • vLLM:通过PagedAttention 技术,高效管理KV Cache,解决内存碎片问题,大幅提升吞吐量,是目前部署服务的事实标准
      • TensorRT-LLM:NVIDIA推出,提供极致的单卡推理性能优化。
    • 采样策略
      • 贪婪解码束搜索:确定性高,适合事实性任务。
      • 温度采样Top-k/p采样:随机性高,适合创造性任务。
  2. 应用模式

    • Agent框架
      • 核心思想:让大模型作为“大脑”,负责规划、调用工具(搜索、计算器、API)、执行和总结。
      • 框架:LangChain, LlamaIndex, ReWOO等。
      • 关键技术思维链工具调用
    • 模型压缩与部署
      • 知识蒸馏:用一个已经训练好的大模型(教师)来教导一个小模型(学生),让学生模型模仿教师模型的行为。
      • 模型服务化:使用Triton Inference Server, TGI 等工具,将模型封装为高并发、低延迟的API服务。
重难点与挑战
  • 难点1:长上下文与“中间丢失”
    • 即使模型支持长上下文,其在处理长文本时,仍然倾向于关注开头和结尾,而忽略中间部分的关键信息。需要通过位置插值等技术来缓解。
  • 难点2:推理的确定性
    • 生成式模型的输出具有内在随机性,这在需要严格一致性的生产环境中是挑战。需要精细控制随机种子和采样参数。
  • 难点3:持续学习与知识更新
    • 世界在变化,而重训模型成本高昂。如何通过持续学习检索增强生成(RAG) 来低成本、无破坏地更新模型知识,是当前最重要的研究方向之一。

更多推荐