本文汇总了大模型从预训练、持续预训练、后训练微调、RLHF对齐、主动学习、注意力优化、KV缓存、量化、归一化、数据集范式、评测体系等知识。

一、大模型完整训练五阶段(核心链路)

大模型从原始基座到可上线对话模型,严格分为五个阶段,是所有LLM工程的底层骨架:

1. 预训练阶段(Pre-training)

基于海量无标注通用文本,采用自监督下一个token预测,让模型学习通用语言、语法、世界知识。

输出:基座Base模型。

特点:懂知识、会续写,但听不懂指令、不会对齐人类意图、安全性差

2. 持续预训练阶段(Continued Pre-training)

属于预训练延伸,不是微调。在已有基座基础上,灌入领域无标注文本,依然使用next-token自监督损失。

作用:补领域知识、更新时效性知识、做领域基座适配。

和SFT核心区别:无指令问答对,纯文本续写范式。

3. 后训练阶段(Post-training)

广义总称:基座预训练完成后,所有对齐人类意图的训练统称为后训练

包含两大核心:SFT有监督微调 + RLHF/DPO人类偏好对齐。

4. 有监督微调SFT

使用高质量指令-回答配对数据训练,只对回答部分计算loss。

核心作用:让模型听懂人类指令、规范输出格式、学会任务范式

局限:只能模仿标注数据,无法区分回答好坏,存在啰嗦、幻觉、不优质问题。

5. 人类反馈强化学习RLHF/DPO

基于人类偏好排序数据,优化回答质量、简洁性、真实性、安全性。

传统RLHF分为:奖励模型RM训练 + PPO强化训练;

工业界主流:DPO直接替代PPO,无需单独训练RM,链路更简单、更稳。

核心:SFT学“对不对”,DPO学“好不好”

二、五大训练链路核心区别(面试必背)

阶段

数据形式

训练范式

核心价值

预训练

海量无标注文本

自监督next-token

学习通用知识与语言能力

持续预训练

领域无标注文本

自监督next-token

领域知识增强、时效更新

SFT微调

指令问答对

有监督微调

学会服从指令、规范输出

RLHF/DPO

偏好排序数据

强化/偏好对齐

优化回答质量、安全、风格

主动学习

海量未标注数据

数据筛选方法论

低成本挖掘高价值难例样本

三、主动学习与业务负反馈闭环

1. 核心思想

不随机标注数据,用模型从未标注池中自动筛选信息增益最大的样本人工标注,以极低标注成本持续提升模型。

2. 三大采样策略

- 不确定性采样:选模型预测最犹豫、熵最大的样本;

- 委员会查询QBC:多模型预测分歧最大的样本;

- 多样性采样:避免样本扎堆,保证场景覆盖。

3. 主动学习 vs 业务BadCase负反馈

- 负反馈:只收集已经出错的线上坏案例,治标不治本,容易过拟合;

- 主动学习:不仅修复已出错样本,还能挖掘潜在风险、模型不确定但未暴露的难例,做到风险前置。

工业最佳实践:离线主动挖掘 + 线上负反馈闭环 + 混入正常样本防偏差

四、大模型评估体系(学术 vs 工业落地)

1. 核心金句

海量数据下,业务评估不依赖统计学完美,依赖高频体感 + 负反馈驱动迭代

2. 学术评测(Harness框架)

lm-evaluation-harness 核心理念:

一切皆插件,一切皆有迹可循

- 一切皆插件:模型后端、评测任务、指标全部可插拔,无需改动核心逻辑;

- 一切皆有迹可循:全量保存prompt、输出、标准答案、配置,可回溯、可复现、可做badcase分析。

作用:版本回归兜底,防止模型退化,不能替代线上真实评测。

3. 工业业务评估逻辑

- 不迷信全局准确率:统计均值会掩盖高频坏case;

- 优先保障Top高频流量场景,容忍极低频长尾错误;

- 以用户体感、会话完成率、重试率、点踩率为核心指标;

- 数据飞轮:线上负反馈回流 → 清洗筛选 → 增量微调迭代。

五、注意力机制优化与KV Cache体系

1. 推理两阶段

- Prefill阶段:全量prompt一次性计算,计算密集型,瓶颈在算力;

- Decode阶段:逐token生成,复用KV缓存,访存密集型,瓶颈在显存带宽。

2. KV Cache核心作用

缓存每一层历史K、V,避免每步重复计算,将Decode复杂度从O(N²)降为O(N),是LLM高速推理的核心。

痛点:KV Cache显存占用通常超过模型权重本身,是并发和长上下文的最大瓶颈。

3. 注意力结构演进(降KV显存)

- MHA:Q/KV头数一致,显存最大;

- MQA:全部Q头共享一组KV,显存极低、精度损失大;

- GQA(工业主流):分组共享KV,精度与显存完美折中;

- MLA:隐向量压缩KV,极致长上下文优化,需重新训练。

4. 工程优化

- FlashAttention:分块计算、Online Softmax,消除O(N²)中间矩阵,加速Prefill、降显存;

- PagedAttention(vLLM核心):KV分页内存管理,解决显存碎片、支持前缀缓存、大幅提升并发。

六、模型量化:GPTQ vs AWQ(工业PTQ后量化)

两者均为训练后权重量化(W4A16),无需重训练,权重4bit、激活FP16。

1. GPTQ

基于Hessian二阶信息,逐层最小化输出误差,逐列补偿量化误差。

优点:通用精度高、生态成熟、Marlin内核吞吐极强,适合大规模线上生产。

缺点:量化校准计算量大、速度慢。

2. AWQ

激活感知量化,识别高贡献权重通道,数学等价缩放保护重要权重,无需Hessian。

优点:量化速度极快、对话生成场景精度更优、小模型/低比特更稳。

缺点:对校准集分布匹配度敏感。

3. 选型总结

- 大厂量产、通用任务、追求极致稳定:GPTQ;

- 自研微调、对话场景、快速量化:AWQ。

七、四大归一化彻底辨析(面试高频坑)

1. 数据集归一化(数据预处理)

对输入特征做MinMax/Z-Score缩放,属于特征尺度对齐优化

作用:抹平特征量纲差异、优化损失地形、加速梯度收敛。

注意:树模型不需要归一化;神经网络、SVM必须归一化。

2. LayerNorm / RMSNorm(LLM标配)

归一网络激活特征,稳定层输入分布、缓解梯度消失、加速收敛。

LLM使用Pre-Norm架构,每一层Attention/FFN前归一激活。

3. WeightNorm 权重归一化

模型可训练权重参数重参数化:W = g·v/||v||

将权重方向与模长解耦,不依赖batch统计,小batch/RL/RNN场景稳定。

重点:LLM Transformer完全不用WeightNorm

4. Softmax 归一(极易混淆)

作用于注意力分数logits,输出概率分布,求和为1;

属于激活变换,不是权重归一、不是数据归一

核心结论:归一化本质是重参数化/数据预处理优化,不更新参数,而是让优化器更好收敛。

八、PyTorch两大数据集范式

1. 映射型数据集 Map-style

继承Dataset,实现__getitem__、__len__,支持随机下标访问

特点:可shuffle、可索引、适合中小静态数据集、SFT微调。

2. 迭代型数据集 Iterable-style

继承IterableDataset,实现__iter__,流式惰性加载、无随机索引

特点:适配TB级预训练语料、无需全量加载内存;无法直接shuffle,多进程需手动分片防重复。

九、AI行业经典金句(可直接背诵)

1. Garbage in,garbage out:数据质量决定模型上限,模型能力只是下限。

2. 一切皆插件,一切皆有迹可循:评测框架插件化、实验可回溯、可复现。

3. Think step by step:思维链显式推理,大幅提升大模型逻辑能力。

4. 静态指标只做兜底,业务迭代靠高频体感与负反馈闭环。

5. 预训练学知识,SFT学指令,DPO学偏好,三者不可替代。

6. Prefill是计算瓶颈,Decode是显存带宽瓶颈。

7. 归一化不直接求解最优解,而是把优化问题变得更容易求解。

8. 映射数据集先有索引再取数据,迭代数据集边迭代边产出数据。

更多推荐