Lion优化器:大语言模型训练的革命性突破,7.5B参数模型效率提升2倍

【免费下载链接】automl Google Brain AutoML 【免费下载链接】automl 项目地址: https://gitcode.com/gh_mirrors/au/automl

还在为训练大型语言模型的高昂计算成本而烦恼吗?传统优化器如AdamW在超大规模模型训练中表现不佳,内存占用大、训练速度慢的问题日益突出。本文将介绍Google Brain团队通过符号程序搜索发现的Lion优化器,它在7.5B参数的语言模型训练中实现了2倍效率提升!

什么是Lion优化器?

Lion(EvoLved Sign Momentum)是通过符号程序搜索技术自动发现的优化算法,相比传统优化器具有以下核心优势:

  • 内存效率提升50%:仅需保存动量,无需二阶矩估计
  • 训练速度提升2-15%:算法简单,运行时开销更小
  • 超参数更少:无需ε参数和因子化相关参数

技术原理揭秘

Lion的核心更新公式极其简洁:

# Lion优化器核心更新步骤(来自[lion_pytorch.py](https://link.gitcode.com/i/e23ab5a99513b68227af4f2d4f8d1a2a))
update = exp_avg * beta1 + grad * (1 - beta1)
p.add_(update.sign_(), alpha=-group['lr'])
exp_avg.mul_(beta2).add_(grad, alpha=1 - beta2)

Lion算法示意图

与传统AdamW需要保存一阶矩和二阶矩不同,Lion只需要动量状态,这在训练超大规模模型时显著降低了内存压力。

大语言模型实战表现

在7.5B参数的语言模型训练中,Lion展现了惊人的性能:

  • 验证困惑度计算成本降低2倍:在Wiki-40B和PG-19数据集上均表现出色
  • 上下文学习能力更强:相比Adafactor获得更好的平均性能
  • 超参数设置:学习率1e-4,权重衰减0.01(对应AdamW的1e-3和0.001)

语言建模性能对比

实际应用指南

超参数调优策略

根据官方文档的建议:

  1. 学习率调整:Lion的学习率通常为AdamW的1/3到1/10
  2. 权重衰减调整:λ值相应增加3-10倍以保持相似强度
  3. 批次大小:Lion偏好较大批次,但在小批次下依然稳健

多框架支持

Lion已集成到主流深度学习框架中:

性能对比分析

超参数敏感性对比

从热力图可以看出,Lion相比AdamW对超参数选择更加鲁棒,这在实际应用中意味着更少的调参成本和更高的训练稳定性。

总结与展望

Lion优化器通过符号程序搜索这一创新方法,为大语言模型训练带来了实质性的突破。其简洁的算法设计、卓越的内存效率和训练速度提升,使其成为训练超大规模模型的理想选择。

随着模型规模的不断增长,优化算法的效率将变得越来越重要。Lion的出现为AI社区提供了一个强有力的工具,有望推动大语言模型训练的进一步发展和普及。

立即尝试:克隆项目 https://gitcode.com/gh_mirrors/au/automl,体验Lion优化器带来的性能提升!


点赞/收藏/关注三连,获取更多AI优化技术干货!下期我们将深入解析符号程序搜索技术的原理与应用。

【免费下载链接】automl Google Brain AutoML 【免费下载链接】automl 项目地址: https://gitcode.com/gh_mirrors/au/automl

更多推荐