19.6 张量并行 TP 与序列并行 SP#
张量并行(Tensor Parallelism, TP)把 Transformer 层内部的两个矩阵乘法按先列切、后行切的顺序分配到多卡,使每层前向只需两次全归约(all-reduce)、反向对称再两次,从而在切分权重与激活的同时把层内通信次数压到最少;序列并行(Sequence Parallelism, SP)沿序列维度切开 TP 未覆盖的 LayerNorm 与 Dropout 区域,把那两次全归约等价替换为规约散射(reduce-scatter)加全收集(all-gather),在通信总量不变的前提下进一步将残留激活显存按并行度线性削减。