Lion优化器:大语言模型训练的革命性突破,7.5B参数模型效率提升2倍
Lion优化器:大语言模型训练的革命性突破,7.5B参数模型效率提升2倍
【免费下载链接】automl Google Brain AutoML 项目地址: https://gitcode.com/gh_mirrors/au/automl
还在为训练大型语言模型的高昂计算成本而烦恼吗?传统优化器如AdamW在超大规模模型训练中表现不佳,内存占用大、训练速度慢的问题日益突出。本文将介绍Google Brain团队通过符号程序搜索发现的Lion优化器,它在7.5B参数的语言模型训练中实现了2倍效率提升!
什么是Lion优化器?
Lion(EvoLved Sign Momentum)是通过符号程序搜索技术自动发现的优化算法,相比传统优化器具有以下核心优势:
- 内存效率提升50%:仅需保存动量,无需二阶矩估计
- 训练速度提升2-15%:算法简单,运行时开销更小
- 超参数更少:无需ε参数和因子化相关参数
技术原理揭秘
Lion的核心更新公式极其简洁:
# Lion优化器核心更新步骤(来自[lion_pytorch.py](https://link.gitcode.com/i/e23ab5a99513b68227af4f2d4f8d1a2a))
update = exp_avg * beta1 + grad * (1 - beta1)
p.add_(update.sign_(), alpha=-group['lr'])
exp_avg.mul_(beta2).add_(grad, alpha=1 - beta2)
与传统AdamW需要保存一阶矩和二阶矩不同,Lion只需要动量状态,这在训练超大规模模型时显著降低了内存压力。
大语言模型实战表现
在7.5B参数的语言模型训练中,Lion展现了惊人的性能:
- 验证困惑度计算成本降低2倍:在Wiki-40B和PG-19数据集上均表现出色
- 上下文学习能力更强:相比Adafactor获得更好的平均性能
- 超参数设置:学习率1e-4,权重衰减0.01(对应AdamW的1e-3和0.001)
实际应用指南
超参数调优策略
根据官方文档的建议:
- 学习率调整:Lion的学习率通常为AdamW的1/3到1/10
- 权重衰减调整:λ值相应增加3-10倍以保持相似强度
- 批次大小:Lion偏好较大批次,但在小批次下依然稳健
多框架支持
Lion已集成到主流深度学习框架中:
- PyTorch:lion_pytorch.py
- TensorFlow:lion_tf2.py
- JAX:lion_optax.py
- Keras、Timm、T5X等主流库均已支持
性能对比分析
从热力图可以看出,Lion相比AdamW对超参数选择更加鲁棒,这在实际应用中意味着更少的调参成本和更高的训练稳定性。
总结与展望
Lion优化器通过符号程序搜索这一创新方法,为大语言模型训练带来了实质性的突破。其简洁的算法设计、卓越的内存效率和训练速度提升,使其成为训练超大规模模型的理想选择。
随着模型规模的不断增长,优化算法的效率将变得越来越重要。Lion的出现为AI社区提供了一个强有力的工具,有望推动大语言模型训练的进一步发展和普及。
立即尝试:克隆项目 https://gitcode.com/gh_mirrors/au/automl,体验Lion优化器带来的性能提升!
点赞/收藏/关注三连,获取更多AI优化技术干货!下期我们将深入解析符号程序搜索技术的原理与应用。
【免费下载链接】automl Google Brain AutoML 项目地址: https://gitcode.com/gh_mirrors/au/automl
更多推荐




所有评论(0)