15.7 量化、剪枝、跳过与蒸馏:把庞大的专家权重压下来#
MoE 的显存大头是几十上百个专家的 FFN 权重,压缩它们的核心难点不在量化技术本身,而在专家异质性(expert heterogeneity),每个专家的数据分布、被激活的热度、对任务的重要性各不相同,因此稠密模型用一套统一缩放策略覆盖全部权重的做法在 MoE 上不再成立。
MoE 的显存大头是几十上百个专家的 FFN 权重,压缩它们的核心难点不在量化技术本身,而在专家异质性(expert heterogeneity),每个专家的数据分布、被激活的热度、对任务的重要性各不相同,因此稠密模型用一套统一缩放策略覆盖全部权重的做法在 MoE 上不再成立。