15.3 专家并行与专家放置#
稠密模型依靠 TP/PP/DP 把一份大权重摊到多卡;混合专家(MoE)额外具有一个天然可切分的维度,专家并行(Expert Parallelism, EP),即将不同专家分置于不同 GPU,token 依路由结果经 All-to-All 送往其选中专家所在的卡。EP 无法孤立评价,它与 TP/DP/PP 的度数组合及专家放置(placement)共同决定通信量与负载是否均衡。
稠密模型依靠 TP/PP/DP 把一份大权重摊到多卡;混合专家(MoE)额外具有一个天然可切分的维度,专家并行(Expert Parallelism, EP),即将不同专家分置于不同 GPU,token 依路由结果经 All-to-All 送往其选中专家所在的卡。EP 无法孤立评价,它与 TP/DP/PP 的度数组合及专家放置(placement)共同决定通信量与负载是否均衡。