MoE 专家并行的 All-to-All 通信瓶颈:专家越多推理延迟为何反而上升
多卡部署稀疏 MoE 时,专家数量增加并不总带来延迟下降。文章以在线推理服务为场景,拆解 token 经 All-to-All 分发与回收的过程,分析跨卡通信量、负载不均和容量因子如何抵消稀疏计算收益,并给出可观测指标与调优边界。
共 3 篇文章
多卡部署稀疏 MoE 时,专家数量增加并不总带来延迟下降。文章以在线推理服务为场景,拆解 token 经 All-to-All 分发与回收的过程,分析跨卡通信量、负载不均和容量因子如何抵消稀疏计算收益,并给出可观测指标与调优边界。
稀疏 MoE 训练常在数千步后突然发散,根源往往不是任务本身,而是路由器 logits 数值膨胀导致 softmax 饱和、梯度消失与专家塌缩。文章以在线多语言训练服务为贯穿场景,解释 z-loss 如何惩罚 logits、logit 钳制与 float32 路由器精度各自修正了什么,并对比仅用负载均衡损失的方案。
围绕大规模 MoE 模型的专家路由机制,解释 Token 如何通过 Top-K Router 只激活少量专家,并分析负载均衡、Shared Expert、Expert Parallelism、All-to-All 通信以及真实推理流量下的热点与部署边界。