15.6 批处理与在线调度#

稠密模型的批处理(batching)只需将 GPU 的算力填满;混合专家(Mixture-of-Experts, MoE)的批处理还需同时满足三项约束,保证每个专家获得足够多的 token、抑制热点专家造成的尾延迟、以及用计算掩盖 All-to-All 通信。由此 MoE 对批规模的依赖更强,对负载不均也更敏感。

登录后才可看