7.6 · 奖励建模、RLAIF 与工程实践#
RL 后训练的成败在很大程度上由奖励信号而非优化算法决定。本节阐明奖励模型(Reward Model, RM)的构造与训练、奖励攻击(reward hacking)的成因与对策,以及在不引入完整 RL 循环时可采用的替代路线。
RL 后训练的成败在很大程度上由奖励信号而非优化算法决定。本节阐明奖励模型(Reward Model, RM)的构造与训练、奖励攻击(reward hacking)的成因与对策,以及在不引入完整 RL 循环时可采用的替代路线。