7.1 为什么需要 RL 后训练:从可复现到可对齐#
预训练赋予模型语言建模能力、监督微调(Supervised Fine-Tuning, SFT)使其复现示范回答,而强化学习(Reinforcement Learning, RL)后训练进一步优化那些无法写成逐 token 监督标签的目标,人类偏好与答案正确性,因为这类目标只能通过评分、反馈、更新的迭代过程逼近,而非逐字模仿一份范本。
预训练赋予模型语言建模能力、监督微调(Supervised Fine-Tuning, SFT)使其复现示范回答,而强化学习(Reinforcement Learning, RL)后训练进一步优化那些无法写成逐 token 监督标签的目标,人类偏好与答案正确性,因为这类目标只能通过评分、反馈、更新的迭代过程逼近,而非逐字模仿一份范本。