15.5 Grouped GEMM 与 Fused MoE 内核#
稠密 FFN 对应一个能充分利用 GPU 的大矩阵乘(GEMM),而 MoE 的专家 FFN 对应一组 token 数各不相同、且逐步变化的小 GEMM。高性能实现的核心工作,是把这组不规则计算重新排布为 GPU 高效执行的规整形状,并将 permute → GEMM → 激活 → combine 融合进尽量少的几个 kernel。
稠密 FFN 对应一个能充分利用 GPU 的大矩阵乘(GEMM),而 MoE 的专家 FFN 对应一组 token 数各不相同、且逐步变化的小 GEMM。高性能实现的核心工作,是把这组不规则计算重新排布为 GPU 高效执行的规整形状,并将 permute → GEMM → 激活 → combine 融合进尽量少的几个 kernel。