Scaling Laws
·
Scaling laws(规模定律) 是指:
在机器学习(尤其是大模型)中,模型性能会随着模型规模、数据量、算力的增加,按照某种可预测的规律提升。
简单理解一句话:
模型越大 + 数据越多 + 训练算力越强 → 性能提升遵循某种“数学规律”,而不是随机提升。
一、最经典的 Scaling Laws 是谁提出的?
在 OpenAI 的论文中(如 2020 年的研究),系统性提出了语言模型的 Scaling Laws。
他们发现:
- 模型参数数量 ↑
- 训练数据量 ↑
- 计算量 ↑
模型的 loss 会按照 幂律(power law)下降
公式类似:
[
Loss ≈ aN^{-α}
]
其中:
- N = 模型规模
- α = 一个常数
- a = 常数
也就是说:
📉 性能提升不是线性的,而是“递减收益”的。
二、Scaling Laws 核心讲什么?
1️⃣ 模型越大,效果越好(在一定范围内)
比如:
- GPT-2 → GPT-3 → GPT-4
- 参数从 1 亿 → 1750 亿 → 更大
能力出现:
- 涌现能力(emergent abilities)
- 少样本学习能力
- 更强推理能力
2️⃣ 数据量必须匹配模型规模
模型大但数据少 → 会过拟合
模型小但数据多 → 训练浪费
所以存在一个:
最优计算分配比例
这就是后来提出的 Chinchilla scaling law。
三、什么是 Chinchilla Scaling Law?
来自 DeepMind 的研究。
结论是:
与其一味增加模型参数,不如模型和数据同时按比例增加。
简单说:
❌ 以前:参数特别大,数据不够
✅ 现在:参数规模和数据量成比例增长
这让模型训练效率更高。
四、Scaling Laws 的现实意义
它解释了:
为什么大模型越来越大?
为什么资本疯狂投入算力?
为什么 GPU 需求暴涨?
因为:
只要按 Scaling Laws 走,性能几乎是“可预测地”变好。
这在工程上非常重要 ——
它意味着 AI 能力可以“用钱买”。
五、但它也有局限
Scaling Laws 主要适用于:
- 预训练阶段
- 语言模型
- 监督学习 loss
它不能解释:
- 对齐问题(alignment)
- 推理能力上限
- RLHF 阶段行为
- 真实世界泛化
所以现在很多人认为:
纯 scaling 可能快到极限了,需要新的范式。
更多推荐
所有评论(0)