一、预训练

核心:模型建模 + 大规模参数优化

  1. 线性代数:矩阵 / 向量运算、张量、矩阵乘法、维度变换(Transformer 基础)
  2. 微积分:偏导数、链式法则、梯度(反向传播核心)
  3. 概率论 & 统计学:概率分布、最大似然估计、熵、困惑度(语言建模目标)
  4. 优化理论:梯度下降、AdamW 等优化器原理、学习率策略
  5. 信息论:信息熵、交叉熵(损失函数)

二、微调

核心:参数小幅更新 + 偏好对齐

  1. 承接预训练:梯度、损失函数、概率分布(基础通用)
  2. 线性代数:低秩矩阵(LoRA 核心:低秩分解)
  3. 概率论:KL 散度、分布对齐(DPO/RLHF 偏好优化)
  4. 运筹 / 强化学习基础:奖励函数、策略梯度(RLHF)

三、模型压缩(量化 / 剪枝 / 蒸馏)

核心:数值近似、权重简化

  1. 数值分析:数值截断、舍入误差、定点数表示(Q4/Q8 量化核心)
  2. 线性代数:矩阵稀疏性、矩阵分解(剪枝、稀疏化)
  3. 概率论:分布拟合、概率蒸馏(模型蒸馏,师生分布对齐)
  4. 最优化:约束优化(量化 / 剪枝时权重约束)

总结

  • 预训练:线代 + 微积分 + 概率统计 + 信息论
  • 微调:在前者基础上,加低秩数学、KL 散度、强化学习基础
  • 压缩:主打数值分析、稀疏矩阵、误差理论

更多推荐