29.1.1 架构总览与核心组件#

Megatron-LM 把大模型分布式训练拆成两层,底层可复用库 Megatron-Coremegatron/core/)提供并行原语、Transformer 构件与配置对象,上层训练脚本(pretrain_gpt.pymegatron/training/)只负责参数解析、数据加载与训练循环;而并行拓扑由 parallel_state.initialize_model_parallel() 一次性把全局 rank 切成 TP/PP/DP/EP/CP 五类通信组,模型则由 GPTModelModuleSpec 规格机制自 TransformerBlockTransformerLayer 逐层组装,每个子模块可替换为 Transformer Engine 的融合算子。

登录后才可看