Scaling laws(规模定律) 是指:
在机器学习(尤其是大模型)中,模型性能会随着模型规模、数据量、算力的增加,按照某种可预测的规律提升

简单理解一句话:

模型越大 + 数据越多 + 训练算力越强 → 性能提升遵循某种“数学规律”,而不是随机提升。


一、最经典的 Scaling Laws 是谁提出的?

在 OpenAI 的论文中(如 2020 年的研究),系统性提出了语言模型的 Scaling Laws。

他们发现:

  • 模型参数数量 ↑
  • 训练数据量 ↑
  • 计算量 ↑

模型的 loss 会按照 幂律(power law)下降

公式类似:

[
Loss ≈ aN^{-α}
]

其中:

  • N = 模型规模
  • α = 一个常数
  • a = 常数

也就是说:
📉 性能提升不是线性的,而是“递减收益”的。


二、Scaling Laws 核心讲什么?

1️⃣ 模型越大,效果越好(在一定范围内)

比如:

  • GPT-2 → GPT-3 → GPT-4
  • 参数从 1 亿 → 1750 亿 → 更大

能力出现:

  • 涌现能力(emergent abilities)
  • 少样本学习能力
  • 更强推理能力

2️⃣ 数据量必须匹配模型规模

模型大但数据少 → 会过拟合
模型小但数据多 → 训练浪费

所以存在一个:

最优计算分配比例

这就是后来提出的 Chinchilla scaling law。


三、什么是 Chinchilla Scaling Law?

来自 DeepMind 的研究。

结论是:

与其一味增加模型参数,不如模型和数据同时按比例增加。

简单说:

❌ 以前:参数特别大,数据不够
✅ 现在:参数规模和数据量成比例增长

这让模型训练效率更高。


四、Scaling Laws 的现实意义

它解释了:

为什么大模型越来越大?
为什么资本疯狂投入算力?
为什么 GPU 需求暴涨?

因为:

只要按 Scaling Laws 走,性能几乎是“可预测地”变好。

这在工程上非常重要 ——
它意味着 AI 能力可以“用钱买”。


五、但它也有局限

Scaling Laws 主要适用于:

  • 预训练阶段
  • 语言模型
  • 监督学习 loss

它不能解释:

  • 对齐问题(alignment)
  • 推理能力上限
  • RLHF 阶段行为
  • 真实世界泛化

所以现在很多人认为:

纯 scaling 可能快到极限了,需要新的范式。

更多推荐