当整个AI行业都在用更大的模型、更多的数据、更长的训练时间堆砌智能时,有一个项目问了一个极其“大逆不道”的问题:如果大模型“规模越大越聪明”这个现象,本质上是因为损失函数设计缺陷导致的“补偿机制”,而不是智能的固有属性,会怎样?

项目地址:https://github.com/dfytensor/Beyond-Scale-Paper


一、为什么这个项目值得你停下来读?

如果你接触过大模型(LLM)训练,你一定对“Scaling Law”耳熟能详:参数越多、数据越多、算力越多,模型就越智能。这几乎成了AI行业的第一性原理——OpenAI、Google、Meta无不沿着这条路狂奔。

Beyond Scale 提出了一个颠覆性的问题:

如果“规模换智能”这个现象,本质上是标准交叉熵损失(Cross-Entropy Loss)把模型权重逼入了“准二值(Quasi-Binary)”状态,迫使模型用更多的参数来弥补被损失函数“扔掉”的信息,会怎样?

Beyond Scale 的核心假设极其大胆:

标准交叉熵损失将模型权重推向低熵、准二值的吸引子状态——只有符号和粗粒度幅度携带行为信号。这种“精度坍缩”迫使模型用规模来补偿,从而解释了观察到的“规模换智能”现象

通过5个受控实验,项目给出了令人震惊的证据:

  • 峰度(Kurtosis) :CE训练的权重峰度高达 6.80,是改进方案的 3-4倍
  • 有效比特深度:精度感知损失函数产生的权重具有明显更高的有效比特深度
  • 4-bit保留率:标准CE仅为 83.6%,而Margin CE高达 91.4%
  • 小模型与大模型的差距:当使用熵正则化目标训练时,小模型与大模型之间的精度差距显著缩小

这不是在损失函数上做点小修小补——它是从优化目标的根源上重新审视了“大模型为什么需要那么大”这个根本问题


二、核心思想:从“赢家通吃”到“精度感知”

2.1 标准交叉熵在做什么?

标准交叉熵损失的定义是:

LCE=−∑tlog⁡pθ(yt∣y<t) \mathcal{L}_{CE} = -\sum_t \log p_\theta(y_t \mid y_{<t}) LCE=tlogpθ(yty<t)

它的优化目标只有一个:让正确token的概率最高。至于高多少、权重如何分布、数值精度是否被浪费——一概不管

当CE损失与LayerNorm/RMSNorm(抹除幅度信息)和低精度算术(BF16只有7位尾数)结合时,形成了一个完美风暴

  1. 赢家通吃:只有logits的排序重要,精细差异无关紧要
  2. 方向重于幅度:归一化确保权重只需编码“哪个方向”,而非“多远”
  3. 精度贫困:BF16无法表示维持高比特深度权重所需的细微梯度

最终结果:权重坍缩到准二值状态——只有符号和粗粒度尺度在行为上相关,模型的有效比特深度远低于其存储格式。

2.2 Beyond Scale的核心逻辑:精度感知的损失设计

Beyond Scale的核心洞察是:

所谓的“规模换智能”定律,部分是一个伪像——是损失函数、归一化和低精度算术共同导致的数值坍缩,而非智能的固有属性

一个显式奖励数值保真度的损失函数,应该能减少这种补偿负担——让更小的模型达到同等的智能水平

项目对比了4种损失函数

损失函数 测试精度 权重熵 峰度 4-bit保留率
标准CE 0.790 −2.00 6.80 83.6%
Margin CE 0.628 0.00 −0.04 91.4%
熵正则化CE 0.782 −1.35 7.73 82.0%
Focal Loss 0.714 0.64 11.69 71.7%

数据来源:

Margin CE 的表现尤为亮眼:

  • 权重熵从 −2.00 提升到 0.00完全消除了负熵坍缩
  • 峰度从 6.80 暴跌到 −0.04接近完美的高斯分布
  • 4-bit量化保留率从 83.6% 提升到 91.4%+7.8个百分点

代价是测试精度从0.790降到0.628——但这是在用精度换取“数值健康” 。项目组的核心论点是:如果能设计出既保持高精度又保持高精度的损失函数,小模型就能达到大模型的效果。

2.3 FP4的启示:低精度能work,恰恰说明了问题

项目组在论文中提到了一个极具洞察力的观察:

最近的研究表明FP4和NF4训练可以达到令人惊讶的低损失。这并非证明低精度足以支撑智能的证据;恰恰相反,它表明标准CE损失本身就不需要高精度——如果4位精度就能work,那说明模型根本就没有在用剩下的精度。

这个逻辑极其犀利:如果你的损失函数不需要高精度,那高精度参数就是浪费。而模型“堆参数”本质上就是在用更多的低精度参数来弥补单个参数信息承载能力的不足。


三、五大实验,层层递进

Beyond Scale项目提供了完整的5大实验验证套件,全部可在一行命令内复现:

python run_loss_experiments.py  # 约3分钟,纯CPU运行

3.1 Fig A1:权重分布直方图

验证内容:不同损失函数下,权重的分布形态有何不同?

预期结果:标准CE的权重分布呈现重尾(heavy-tailed) 特征——大量权重集中在零附近,少量权重取值极大。这是“准二值坍缩”的直观证据。

3.2 Fig A2:有效比特深度保留曲线

验证内容:随着训练进行,模型权重的“有效比特深度”如何变化?

预期结果:精度感知损失函数(如Margin CE)能维持更高的有效比特深度,而标准CE的有效比特深度会持续下降。

3.3 Fig B:样本效率对比

验证内容:不同损失函数下,模型达到相同精度需要多少样本?

预期结果:精度感知损失函数用更少的样本就能达到相同的精度——意味着更高的样本效率。

3.4 Fig C:量化坍缩阈值

验证内容:当量化位宽逐渐降低时,不同损失函数训练的模型在哪个阈值发生“精度崩盘”?

预期结果:Margin CE的4-bit保留率达91.4%,显著优于标准CE的83.6%。

3.5 Fig D:参数效率曲线

验证内容:不同损失函数下,模型精度如何随参数量变化?

这是最关键的实验:如果Beyond Scale的假设成立,那么使用精度感知损失函数时,小模型与大模型的精度差距应该显著缩小

3.6 Fig E:比特级扰动敏感性

验证内容:对权重的不同比特位施加扰动,对最终输出的影响有多大?

预期结果:标准CE训练的模型对高位比特的扰动极其敏感(因为有效信息都集中在高位),而精度感知损失函数训练的模型对扰动的鲁棒性更强


四、快速上手

4.1 环境要求

# Python 3.x
# 依赖:numpy, matplotlib(具体依赖见项目)
pip install numpy matplotlib

4.2 一键运行全部实验

git clone https://github.com/dfytensor/Beyond-Scale-Paper
cd Beyond-Scale-Paper
python run_loss_experiments.py  # 约3分钟,纯CPU

4.3 输出文件

所有结果输出到 output/ 目录:

文件 内容
figA1_weight_histograms.png 权重分布直方图
figA2_effective_bits.png 有效比特深度保留曲线
figB_sample_efficiency.png 样本效率对比
figC_quantization.png 量化坍缩阈值
figD_param_efficiency.png 参数效率曲线
figE_perturbation.png 比特级扰动敏感性
all_loss_results.json 全部数值结果

4.4 阅读论文

# 在浏览器中打开 paper.html
# 或生成 PDF
# 在浏览器中打开 paper.html → 打印 → 保存为 PDF

五、总结与思考

Beyond Scale 的价值,远不止于“又出了一个新损失函数”。它真正值得深思的地方在于:

第一,它挑战了“Scaling Law”的因果解释。当整个行业都在把“规模换智能”当作第一性原理时,Beyond Scale 用实验证明:这个现象至少部分是由损失函数的缺陷造成的,而非智能的固有属性。这就像是在问:如果改变优化目标,小模型是不是也能有大智慧?

第二,它揭示了标准CE损失的“隐藏成本” 。CE损失不惩罚数值精度的浪费——于是模型用更多的参数来弥补单个参数信息承载能力的不足。堆参数,某种程度上是在为损失函数的缺陷买单

第三,它为“小模型”开辟了新的可能性。如果精度感知的损失函数能让小模型与大模型的差距显著缩小,那我们或许不再需要在“模型大小”和“智能水平”之间做艰难取舍。

第四,它的代码极简、极快、极透明。5个实验,3分钟,纯CPU运行——没有黑箱,没有隐藏trick,真正的可复现科研

当然,Beyond Scale 目前还是在合成任务上的验证,尚未在真实LLM(LLaMA、Qwen等)上大规模验证。但它打开了一扇门:如果大模型的未来不一定是“更大”,而是“更聪明的损失函数”呢?

项目地址:https://github.com/dfytensor/Beyond-Scale-Paper

欢迎star、fork、提issue——一起探索大模型“去规模化”的另一种可能。

更多推荐