9.2.5 并行:将超出单卡容量或吞吐能力的模型分摊到多卡#
当模型规模超出单卡显存容量,或吞吐/延迟指标无法由单卡满足时,需将模型与请求分摊到多张 GPU 协同计算。主要切分维度有四种,张量并行(Tensor Parallelism, TP) 切分每层内部矩阵、流水线并行(Pipeline Parallelism, PP) 切分层与层之间、专家并行(Expert Parallelism, EP) 切分 MoE 专家、数据/副本并行(Data Parallelism, DP) 整份复制以扩展吞吐;在此之上可叠加 PD 解耦,将 prefill 与 decode 两阶段分离部署。每种切法都是在容量、延迟、吞吐、通信开销之间的权衡[^megatron]。