7.3 · RLHF:奖励模型 + PPO#RLHF 先用成对偏好数据(A 比 B 好)训练一个输出标量分数的奖励模型(RM),再用 PPO 将该分数作为奖励优化语言模型,并以 KL 惩罚约束策略不过度偏离参考模型。登录后才可看登录 Satori 账户