19.2 分布式训练总论#
分布式训练要同时解决两件事,单卡装不下完整训练状态(显存墙)与单卡跑不完万亿 token(时间墙);显存的构成可精确核算(混合精度加 Adam 约为每参数 16 字节的静态开销,再加与序列长度、批量相关的激活值),而并行策略的取舍则由通信带宽决定其作用域(张量并行留在机内 NVLink,流水线并行可跨机,数据并行对带宽要求最低)。
分布式训练要同时解决两件事,单卡装不下完整训练状态(显存墙)与单卡跑不完万亿 token(时间墙);显存的构成可精确核算(混合精度加 Adam 约为每参数 16 字节的静态开销,再加与序列长度、批量相关的激活值),而并行策略的取舍则由通信带宽决定其作用域(张量并行留在机内 NVLink,流水线并行可跨机,数据并行对带宽要求最低)。