29.3.2 PPO/GRPO 数据流、rollout 与配置#

verl 的一次 RL 迭代由驱动进程(driver)在 RayPPOTrainer.fit() 里串成一条固定数据流,采样提示词、由 rollout 引擎(vLLM/SGLang)批量生成回答、重算 old/ref 对数概率与状态价值、计算奖励与 KL 惩罚、估计优势(PPO 用广义优势估计 GAE、GRPO 用组内归一化)、再做带裁剪目标的 actor/critic 更新;每次更新后必须把新权重经混合引擎权重同步(HybridEngine weight sync)重分片并推入推理引擎,才能进入下一轮生成,这正是训练侧与推理侧之间的桥。

登录后才可看