15.1 瓶颈总览:MoE 层为什么推理难#

混合专家(Mixture-of-Experts, MoE)令每个 token 仅经过 top-$k$ 个专家,从而降低了每 token 的计算量(FLOPs),却把稠密模型中一次前向即完成的单条路径替换为 router → dispatch → All-to-All → Grouped GEMM → combine → scheduler 的六段流水线,使推理瓶颈由计算不足转移至通信、显存、负载不均三者。

登录后才可看