15.8 专家卸载、解耦部署与 Benchmark#
MoE 推理优化的最后一层不在单个 kernel,而在服务架构(serving architecture),显存不足时将冷专家卸载到 CPU 或 SSD 并按需换入,规模扩大时将 attention 与专家拆分为可独立扩容的资源池,最后以一套公平的 benchmark 把前七节的优化串联起来完成选型。
MoE 推理优化的最后一层不在单个 kernel,而在服务架构(serving architecture),显存不足时将冷专家卸载到 CPU 或 SSD 并按需换入,规模扩大时将 attention 与专家拆分为可独立扩容的资源池,最后以一套公平的 benchmark 把前七节的优化串联起来完成选型。