19.9 训练框架实战(Megatron-LM、DeepSpeed)#
本节把 18.2–18.8 讲过的各类并行与显存优化策略落到两套主流框架上,Megatron-LM 以张量并行(Tensor Parallelism, TP)与流水线并行(Pipeline Parallelism, PP)的原生实现见长,DeepSpeed 以 ZeRO 三级切分与 Offload 见长;真正训练千亿参数模型时,二者被组合成三维并行(3D parallelism),即在同一 GPU 集群上让 TP 沿节点内、PP 跨节点、DP/ZeRO 复制副本三个正交轴各司其职。