29.4.1 架构:Megatron 训练 × SGLang rollout 解耦#
slime 的核心设计是把强化学习后训练中参数更新与样本生成两类性质迥异的计算彻底解耦,训练侧交给 Megatron-Core、生成侧交给 SGLang,二者作为独立的 Ray actor 各自扩展,中间以一个数据缓冲区(Data Buffer)传递经验、以一次显式的权重同步把训练好的参数推入生成引擎。
slime 的核心设计是把强化学习后训练中参数更新与样本生成两类性质迥异的计算彻底解耦,训练侧交给 Megatron-Core、生成侧交给 SGLang,二者作为独立的 Ray actor 各自扩展,中间以一个数据缓冲区(Data Buffer)传递经验、以一次显式的权重同步把训练好的参数推入生成引擎。