29.1.1 架构总览与核心组件#
Megatron-LM 把大模型分布式训练拆成两层,底层可复用库 Megatron-Core(megatron/core/)提供并行原语、Transformer 构件与配置对象,上层训练脚本(pretrain_gpt.py与megatron/training/)只负责参数解析、数据加载与训练循环;而并行拓扑由parallel_state.initialize_model_parallel()一次性把全局 rank 切成 TP/PP/DP/EP/CP 五类通信组,模型则由GPTModel经ModuleSpec规格机制自TransformerBlock到TransformerLayer逐层组装,每个子模块可替换为 Transformer Engine 的融合算子。