下周二晚8点!聊聊OpenMoE 2,为什么 Diffusion MoE 可能是下一代大模型架构方向
青稞社区:https://qingkeai.online/
原文:https://mp.weixin.qq.com/s/9zqA5L-EYs0Ny-4mLYCwKw
OpenMoE 2 是第一个 moe+diffusion language model (DLM) 的架构研究,并且会from scratch训一个完全开源的diffusion moe系列。
Blog:https://jinjieni.notion.site/OpenMoE-2-Sparse-Diffusion-Language-Models-277d8f03a8668065a4ecd23f23bd6aac
代码:https://github.com/JinjieNi/OpenMoE2

一些主要的takeaway:
1、DLM的non-causal modeling让它天然适合用expert-choice routing。expert-choice routing在很多方面都优于token-choice的routing。
- 天生完美的load balancing。从而去除了额外的auxiliary loss,需要调的参数少了,模型学习目标更集中了。同时不会因为load-balancing OOM了,也不需会出现under train的expert。
- 完美的load-balancing也使得训练和inference有大幅的吞吐量提升(根据olmoe大约20%,我们没有严格benchmarking)。本质原因是,在token-choice的moe里,某一个expert会被分到特别多的token(dropless),那整体的throughput就会被这个expert bound住。而在完美的load balancing下,expert的分配更均衡,大大提升了moe的吞吐量。
- expert-choice moe天然能实现adaptive computing,更重要的token会被计算得更多,相对不重要的token会被计算得更少甚至丢弃。加1-2个shared expert即可完美解决token 丢弃带来的性能损失。
2、diffusion moe有一个更广,更可控的density range:可以根据目标任务的reasoning-knowledge ratio灵活调整,调整diffusion steps实现parameter-free flops adjustment,调整moe sparsity实现flops-free parameter adjustment。
3、在multi-epoch training里,DLM和moe是一个双赢组合。我们观察到在这种重复数据的setting下,8b1a的moe < 8b dense < 1b dense (都是autoregressive)。我们观察到8b dense因为参数太多过拟合而导致它比1b dense差;
那么8b1a的moe按理来说有效参数比8b dense少,因此在这种重复数据的setting下应该比8b dense好才对,但我们观察到它的性能远差于8b dense。这个现象说明在multi-epoch training里,flop和parameter都起到了决定性作用(相比8b dense,8b1a的moe只差在了flops)。
相反我们观察到,diffusion moe在multi epoch training下的趋势正常:1b dense < 8b1a < 8b。我们觉得diffusion moe极高的flops-param ratio在这里起了关键作用。
我们还做了不少其它架构的ablation,比如adaptive computing的重要性,shared expert对ec moe的重要性,scaling factor的重要性,upcycling的重要性等等…
11月4日(周二)晚8点,青稞Talk 第85期,NUS AI Researcher倪瑾杰,将直播分享《OpenMoE 2: Sparse Diffusion Language Models》,聊一聊为什么 Diffusion MoE 可能是下一代大模型架构方向。
分享嘉宾
倪瑾杰,NUS AI Researcher, 研究兴趣包括Large language models、pretraining、Diffusion language models、Reinforcement learning for LLM reasoning、Model architectures。
主题提纲
OpenMoE 2: Sparse Diffusion Language Models
1、Diffusion Language Model 概述
2、OpenMoE 2:DLM + MoE
- Diffusion MoE 的可调密度与灵活计算
- 多轮训练(multi-epoch)下的对比分析
3、未来研究的探讨
直播时间
11月4日(周二)20:00 - 21:00
如何观看
Talk 将在青稞社区【视频号:青稞AI、Bilibili:青稞AI】上进行直播,欢迎观看~
同时,嘉宾已经入驻青稞社区·知识星球,想要提问交流的朋友可以加入星球!

更多推荐
所有评论(0)