@dyedd 在 解读 TAOT:MoE 动态副本调度优化 EP 负载的新思路 中发帖
我常说自己现在是研究训练 infra 的,但回顾自己在个人博客等平台发表的文章,一直没有在这个方向有所产出。所以,借着这次契机来分享和学习一下我们团队最近发表的一篇关于专家并行不均衡问题的文章吧。
背景
论文地址:https://arxiv.org/pdf/2608.03676
[ed05999902a108aa30448755c7d786a6]
翻译一下,TAOT:面向混合专家模型训练中动态专家副本放置的拓扑感知最优传输方法
这篇论文名称看似复杂,实际上还是解决MoE一个老生常谈的负载不均衡问题,即我们在做EP并行的时候,每张卡能处理多少token,完全由路由动态分配,如果我们不进行人为的干预,那么就会造成某些卡一直在计算,而某些卡一直或者不间断的空闲摸鱼。
[image]
所以,这个问题要治!
其实业界和学术界有许多应对思路,在算法层面,像DeepSeek等MoE系列...