29.4.2 端到端工作流与使用#

slime 的一次 RL 迭代(框架内叫一个 rollout step)就是一条闭环,RolloutManager 驱动 SGLang 推理引擎为一批 prompt 采样出若干条回答,奖励/校验器(reward / verifier)给每条回答打分,数据经 Data Buffer 整理成训练样本按数据并行(Data Parallel, DP)切分,Megatron 训练 actor 拉走这批数据做一次 GRPO/PPO 策略更新,再把更新后的权重同步回 SGLang 引擎,进入下一轮;train.py采样训练严格串行(同步),train_async.py 让第 $i{+}1$ 轮采样与第 $i$ 轮训练重叠(异步)。

登录后才可看