大模型:阶段简介
·
第一阶段:预训练 - 铸造模型的“世界观”
这是最耗时、耗资最巨大的阶段,目标是赋予模型通用的语言理解和世界知识。
核心框架与技术要点
-
模型架构:Transformer的统治
- 核心:几乎全部基于Transformer的Decoder-only(如GPT、LLaMA)或Encoder-Decoder(如T5)架构。当前,Decoder-only是生成式大模型的主流。
- 技术演进:
- 归一化技术:从LayerNorm发展到RMSNorm,计算更简单,效果更好。
- 激活函数:从ReLU、GELU发展到SwiGLU/SiLU,提升模型表达能力。
- 位置编码:从绝对位置编码(如Sinusoidal)发展到更擅长外推的旋转位置编码(RoPE),使模型能处理比训练时更长的文本。
- 注意力机制优化:为应对长上下文带来的计算复杂度(O(n²)),引入分组查询注意力(GQA) 和多头潜在注意力(MLA) 等技术,在几乎不损失效果的前提下大幅降低KV Cache,提升推理速度。
-
训练框架:分布式训练的工程奇迹
- 核心框架:
- Megatron-LM:NVIDIA推出,擅长张量并行,将模型层内的矩阵计算拆分到多个GPU上。
- DeepSpeed:Microsoft推出,其ZeRO 技术擅长数据并行下的显存优化,能将优化器状态、梯度、参数分片到所有GPU上,实现超大规模模型训练。
- 实践:通常结合使用,形成
Megatron-DeepSpeed框架,实现混合并行。- 数据并行:在不同GPU上处理不同批次的数据。
- 张量/流水线并行:将单个大模型本身拆分到多个GPU上。
- 核心框架:
-
数据工程:质量决定天花板
- 流程:海量原始数据 -> 去重 -> 质量过滤(基于启发式规则、模型打分) -> 隐私信息脱敏 -> 分词。
- 技术要点:
- 分词器:主流使用Byte-Pair Encoding 及其变种(如SentencePiece),能在词汇量和序列长度间取得良好平衡。
- 数据配比:这是核心艺术。代码数据能提升逻辑性,学术论文提升推理能力,网页数据保证多样性。不同数据源的混合比例对最终模型能力有决定性影响。
重难点与挑战
- 难点1:巨大的算力与成本
- 训练一个千亿级模型需要数千张GPU数月时间,成本可达数千万美元。如何提高训练效率(Tokens/Second)是首要难题。
- 难点2:数据质量与偏见
- 互联网数据天然包含大量噪声、错误信息和偏见。如何有效清洗和过滤,避免“垃圾进,垃圾出”,是保证模型安全性和可靠性的基石。
- 难点3:训练的稳定性
- 在超大规模训练中,损失尖峰 是常见问题。轻微的数值不稳定可能导致训练崩溃。需要精细的调参(学习率、热身策略、梯度裁剪)和损失监控与回退机制。
- 难点4:可复现性与评估
- 由于数据、超参数和随机性的巨大影响,完全复现一个SOTA模型几乎不可能。同时,在训练中期如何科学地评估模型能力(而不只是看损失),并据此调整策略,是一个开放问题。
第二阶段:监督微调 - 塑造“对话人格”
此阶段让“通才”基座模型变成“专才”助手。
核心框架与技术要点
-
数据构建:指令数据的艺术
- 来源:
- 人工撰写:质量最高,但成本高昂。
- Self-Instruct:利用基座模型自己生成种子指令,再经过筛选和人工修正。
- 合成数据:通过更强大的模型(如GPT-4)为查询生成高质量回答。
- 技术要点:
- 多样性:指令需覆盖各种任务类型(问答、创作、推理、总结、编码等)。
- 复杂性:需要包含单轮、多轮对话,以及需要多步推理的复杂指令。
- 对齐目标:数据应体现有帮助的、诚实的、无害的 行为准则。
- 来源:
-
微调方法:参数高效微调成为主流
- LoRA:核心思想是假设模型微调时的权重更新是低秩的。通过引入两个小的可训练矩阵A和B(其乘积 ΔW = BA)来近似全参数更新。优势:大大减少可训练参数量(通常仅为原模型的0.1%~1%),训练出的Adapter可以合并回原模型,不引入推理延迟。
- QLoRA:在LoRA基础上,将预训练权重量化为4-bit(NF4格式),并通过一种叫双量化的技术进一步压缩。在前向和反向传播时,动态地将权重反量化为BF16进行计算。优势:使得在单张24GB显存的消费级显卡上微调650亿参数的模型成为可能。
- 全参数微调:在计算资源极度充足且数据质量非常高的情况下,全参数微调的理论性能上限仍然最高。
重难点与挑战
- 难点1:灾难性遗忘
- 模型在适应新任务(对话)时,可能会遗忘在预训练阶段学到的宝贵通用知识。需要通过适当的学习率、混合预训练数据 或防止遗忘的正则化技术来缓解。
- 难点2:数据质量与数量平衡
- 几千条高质量的SFT数据可能比几十万条低质数据效果更好。如何设计数据配方,以最低成本达到最优效果,是核心挑战。
- 难点3:过拟合与“鹦鹉学舌”
- 如果SFT数据风格单一,模型可能会机械地模仿数据中的回答模式,缺乏泛化能力。需要确保数据多样性并进行严格的验证集评估。
第三阶段:人类对齐 - 学习“察言观色”
让模型的理解与人类的偏好、价值观和安全准则对齐。
核心框架与技术要点
-
RLHF
- 流程:
- 奖励模型训练:
- 数据:收集人类对多个模型回答的排序数据(如A > B > C)。
- 训练:训练一个独立的奖励模型,学习预测人类更喜欢哪个回答。通常使用** pairwise ranking loss**。
- 强化学习微调:
- 环境:SFT模型。
- Agent:需要优化的策略模型。
- 奖励:RM给出的分数 + 惩罚项。
- 算法:常用PPO。为防止策略模型偏离SFT基础太远,会加入KL散度惩罚。
- 奖励模型训练:
- 技术要点:PPO的实现非常复杂,需要精细的超参数 tuning 和多个模型(策略模型、参考模型、奖励模型)的协同训练。
- 流程:
-
DPO
- 核心思想:一种无奖励模型的替代方案。它通过一个巧妙的数学推导,将偏好学习问题转化为一个直接的有监督损失函数。
- 流程:直接使用偏好数据(赢家回答 vs 输家回答),通过一个闭式解来优化策略模型,使其增加生成赢家回答的概率,降低生成输家回答的概率。
- 优势:大大简化了训练流程,更稳定,计算成本更低,已成为RLHF的强大竞争对手。
重难点与挑战
- 难点1:“对齐税”
- 对齐过程可能会轻微降低模型在某些通用任务(如代码生成、数学推理)上的能力,这种现象被称为“对齐税”。需要在帮助性和无害性之间做出权衡。
- 难点2:奖励模型的“胡言乱语”
- RM本身也是一个语言模型,它可能无法真正理解人类的复杂价值观,或者对某些“胡说八道”但看起来流畅的回答给出高分。RM的质量直接决定了RLHF的上限。
- 难点3:泛化性与“越狱”
- 对齐是在有限数据上进行的,模型可能学会在训练过的情境下表现良好,但对新的、恶意的提示(越狱攻击)缺乏鲁棒性。这是一个持续的安全攻防战。
第四阶段:推理与应用 - 从实验室到生产
核心框架与技术要点
-
推理加速
- 量化:
- 训练后量化:最简单,但可能损失精度。
- 量化感知训练:在训练/微调时模拟量化过程,获得更好的低精度模型。
- AWQ/GPTQ:主流的高级PTQ方法,能更好地保护权重中对模型性能至关重要的“突出权重”。
- 推理框架:
- vLLM:通过PagedAttention 技术,高效管理KV Cache,解决内存碎片问题,大幅提升吞吐量,是目前部署服务的事实标准。
- TensorRT-LLM:NVIDIA推出,提供极致的单卡推理性能优化。
- 采样策略:
- 贪婪解码、束搜索:确定性高,适合事实性任务。
- 温度采样、Top-k/p采样:随机性高,适合创造性任务。
- 量化:
-
应用模式
- Agent框架:
- 核心思想:让大模型作为“大脑”,负责规划、调用工具(搜索、计算器、API)、执行和总结。
- 框架:LangChain, LlamaIndex, ReWOO等。
- 关键技术:思维链 和 工具调用。
- 模型压缩与部署:
- 知识蒸馏:用一个已经训练好的大模型(教师)来教导一个小模型(学生),让学生模型模仿教师模型的行为。
- 模型服务化:使用Triton Inference Server, TGI 等工具,将模型封装为高并发、低延迟的API服务。
- Agent框架:
重难点与挑战
- 难点1:长上下文与“中间丢失”
- 即使模型支持长上下文,其在处理长文本时,仍然倾向于关注开头和结尾,而忽略中间部分的关键信息。需要通过位置插值等技术来缓解。
- 难点2:推理的确定性
- 生成式模型的输出具有内在随机性,这在需要严格一致性的生产环境中是挑战。需要精细控制随机种子和采样参数。
- 难点3:持续学习与知识更新
- 世界在变化,而重训模型成本高昂。如何通过持续学习或检索增强生成(RAG) 来低成本、无破坏地更新模型知识,是当前最重要的研究方向之一。
更多推荐
所有评论(0)