Beyond Scale:大模型“堆参数”的元凶找到了——标准交叉熵把权重逼成了二值!
当整个AI行业都在用更大的模型、更多的数据、更长的训练时间堆砌智能时,有一个项目问了一个极其“大逆不道”的问题:如果大模型“规模越大越聪明”这个现象,本质上是因为损失函数设计缺陷导致的“补偿机制”,而不是智能的固有属性,会怎样?
项目地址:https://github.com/dfytensor/Beyond-Scale-Paper
⚠️ 重要更新(2026年7月)
在继续阅读之前,请务必注意:项目组在2026年7月完成了一轮完整的消融实验,对先前的一些结论进行了重大修正:
完整LR扫描证实:MA-RMSNorm的全部“优势”为LR-regime伪影。
- 默认
3e-4的学习率偏低约13倍,仅调高LR即可获得**−59%**的ppl改善(41.7→17.1)- 在matched-LR下,MA的收益随LR升高单调收窄,并在高LR时反转
- 各自最优LR下,MA ≈ RMS(−0.5%噪声) ——ma2只是偏好更低的最优LR,显得碾压
- 结论:砍掉MA,用RMSNorm + 充分调高的LR
但这并不意味着整个项目没有价值——恰恰相反,消融实验本身揭示了一个更根本的发现:标准交叉熵(CE)损失确实存在“权重二值坍缩”问题,而KALC(训练级解决方案)经受住了考验。
一、为什么这个项目值得你停下来读?
如果你接触过大模型训练,你一定对“Scaling Law”耳熟能详:参数越多、数据越多、算力越多,模型就越智能。这几乎成了AI行业的第一性原理。
但 Beyond Scale 提出了一个颠覆性的问题:
如果“规模换智能”这个现象,本质上是标准交叉熵损失把模型权重逼入了“准二值(Quasi-Binary)”状态,迫使模型用更多的参数来弥补被损失函数“扔掉”的信息,会怎样?
Beyond Scale 的核心假设是:
标准交叉熵损失将模型权重推向低熵、准二值的吸引子状态——只有符号和粗粒度幅度携带行为信号。这种“精度坍缩”迫使模型用规模来补偿,从而解释了观察到的“规模换智能”现象。
通过3层递进实验,项目给出了令人信服的证据。
二、核心思想:从“赢家通吃”到“精度感知”
2.1 标准交叉熵在做什么?
标准交叉熵损失的定义是:
LCE=−∑tlogpθ(yt∣y<t) \mathcal{L}_{CE} = -\sum_t \log p_\theta(y_t \mid y_{<t}) LCE=−t∑logpθ(yt∣y<t)
它的优化目标只有一个:让正确token的概率最高。至于高多少、权重如何分布、数值精度是否被浪费——一概不管。
当CE损失与RMSNorm(抹除幅度信息)和低精度算术(BF16只有7位尾数)结合时,形成了一个完美风暴:
- 赢家通吃:只有logits的排序重要,精细差异无关紧要
- 方向重于幅度:归一化确保权重只需编码“哪个方向”,而非“多远”
- 精度贫困:BF16无法表示维持高比特深度权重所需的细微梯度
最终结果:权重坍缩到准二值状态——只有符号和粗粒度尺度在行为上相关,模型的有效比特深度远低于其存储格式。
2.2 两套互补解决方案
项目提出了两套解决方案:
| 方案 | 层级 | 核心思想 |
|---|---|---|
| KALC | 训练级 | 用MAD-based硬裁剪替代基于梯度的惩罚,绕过 1/N 梯度稀释壁垒 |
| MA-RMSNorm | 架构级 | 在RMSNorm基础上增加幅度感知路径(已被消融实验证伪,详见上文) |
KALC是真正经受住考验的方案,而MA-RMSNorm的“优势”已被证实为学习率伪影。
三、三大实验,层层递进
3.1 Layer 1 — CPU概念验证(4K参数)
| 损失函数 | Test Acc | 峰度(Kurtosis) | 4-bit Acc |
|---|---|---|---|
| 标准CE | 0.792 | 6.79 | 0.772 (−2.0%) |
| Margin CE | — | −0.07 | 坍缩 |
| Focal Loss | 0.714 | 11.69 | 0.714(退化) |
| KALC | 0.784 | −0.00 | 0.784(Δ0.0%) |
数据来源:
KALC实现了峰度→0,且4-bit量化零退化——证明了非二值权重可以实现无损量化。
3.2 Layer 2 — LLM规模化验证(3180万参数)
| 方法 | eval ppl | int4 ppl | int4退化 |
|---|---|---|---|
| 标准CE | 38.29 | 47.43 | 23.86% |
| KALC 3×MAD裁剪 | 38.33 | 44.30 | 15.57% |
数据来源:
int4困惑度提升了6.6%,且零ppl代价。
关键发现:1/N梯度稀释壁垒——基于梯度的惩罚在3180万参数上弱了1000倍。解决方案是MAD-based硬裁剪,完全绕过梯度。
3.3 Layer 3 — MA-RMSNorm v2 + KALC + Scaling(已修正)
⚠️ 以下数据已被消融实验修正(见文首警告) ,仅供参考:
| 配置 | eval ppl | vs RMS基线 | 备注 |
|---|---|---|---|
| RMS H=320 L=6(3180万) | 41.7 | 基线 | — |
| MA-v2 H=320 L=6 + KALC | 34.5 | −17.3% | int4 ppl −17.6% |
| MA-v2 H=256 L=6(2100万) | 40.5 | 击败RMS 3180万! | 参数减少34% |
| MA-v2 H=320 L=6(3180万) | 34.5 | 击败RMS L=12(6000万,ppl=36.6) | 层数减半,参数节省47% |
数据来源:
关键洞察:经过消融实验后,这17%的提升被归因于学习率偏低而非MA架构本身。但这恰恰说明:通过简单的学习率调优,就能让RMSNorm达到与复杂MA方案相同的效果——这对实际工程有直接的指导意义。
四、快速上手
4.1 一键运行实验
git clone https://github.com/dfytensor/Beyond-Scale-Paper
cd Beyond-Scale-Paper
# 运行完整消融实验
python run_ablation.py
4.2 核心文件
| 文件 | 说明 |
|---|---|
README.md |
项目主文档(含关键结果) |
FINDINGS.md |
消融实验完整记录(2026年7月更新) |
model.py |
RMSAmpNorm实现(简化版MA等价替代) |
run_ablation.py |
消融实验脚本 |
五、总结与思考
Beyond Scale 项目最值得深思的地方,恰恰在于它自我修正的过程:
第一,它证明了“权重二值坍缩”是一个真实存在的问题。标准CE损失确实会把权重推向低熵、准二值状态,导致4-bit量化退化高达23.86%。
第二,KALC经受住了考验。在消融实验推翻了MA-RMSNorm的“神话”之后,KALC依然保持有效——int4退化从23.86%降至15.57%,提升6.6%。
第三,它揭示了一个容易被忽视的工程真相:学习率调优比架构创新更重要。默认3e-4偏低约13倍,仅调高LR即可获得−59%的ppl改善。很多时候,所谓的“架构优势”不过是学习率没调好的假象。
第四,它展示了什么是真正的科研精神:发现问题 → 提出假设 → 实验验证 → 发现错误 → 公开修正。项目组没有隐藏“翻车”的发现,而是专门写了FINDINGS.md详细记录消融过程——这在当今学术界尤为可贵。
当然,Beyond Scale 目前还是在3180万参数规模上的验证,尚未在百亿/千亿级LLM上大规模验证。但它打开了一扇门:如果大模型的未来不一定是“更大”,而是“更聪明的训练策略”呢?
项目地址:https://github.com/dfytensor/Beyond-Scale-Paper
欢迎star、fork、提issue——一起探索大模型“去规模化”的另一种可能。
更多推荐
所有评论(0)