5.3 · 预训练框架:Megatron-LM、DeepSpeed 与 torchtitan#

预训练框架的职责,是用切分(并行)、卸载(offload)与低精度三类机制,把一个单卡显存无法容纳、单卡算力无法快速训练的模型,分布到成百上千张 GPU 上,同时对上层保持接近单卡的训练循环接口。

登录后才可看