为什么必须研究负载均衡
风控场景对推理耗时有着严格的 SLA 约束。Dense 模型的总参数量与激活参数量相等,模型尺寸被耗时预算直接锁死。MoE 架构通过路由机制将总参数量与激活参数量解耦——总参可大,激活可控——使其在同等耗时下具备更大的模型容量,成为风控场景的必然选择。
但 Dense 模型做 SFT 只优化任务损失即可;MoE 做 SFT 则不同。路由模块在训练初期微小的随机偏好会被自我强化:被选中的专家获得更多更新,拟合更好,被进一步偏好,最终少数专家过载、其余专家长期得不到训练而退化。这就是路由坍塌(Routing Collapse)。它是 MoE 的默认归宿,而非边界情况。
因此,负载均衡不是 MoE 的可选优化项,而是 SFT 阶段能否产出可用模型的前提条件。不解决它,MoE 架构的优势会在训练中自行瓦解。
本系列的目标
本文系列是对 MoE 负载均衡方法论的系统学习笔记,按方法演进顺序依次展开:
-
软正则:Importance Loss、Expected Load Loss、f·P 辅助损失及多层级变体——用损失函数"劝导" Router 保持均衡;
-
硬兜底:Expert Capacity 与 Token Dropping——工程层面限制最坏负载;
-
路由重构:Expert Choice 与 Balanced Assignment——改变"token 选专家"的默认范式,从构造上保证均衡;
-
在线控制:Auxiliary-Loss-Free 动态 Bias——不依赖梯度惩罚,通过反馈调节实现均衡。
每一类方法对应不同的均衡保证强度与系统代价。下文从最早的方法开始。