9.6 训练期并行:将大模型分布到大规模加速卡集群#
如 资源核算 所示,一个数十至上百亿参数的模型,仅参数、梯度与优化器状态之和即远超单卡显存,因此大模型训练必须切分到多卡多机。三种基本切分方式各对应一个维度:数据并行(Data Parallelism, DP)切分 batch,张量并行(Tensor Parallelism, TP)切分单层矩阵,流水线并行(Pipeline Parallelism, PP)切分层;三者组合即 3D 并行。这是 CS336 第 7–8 讲的核心内容[^cs336]。