7.4 直接偏好优化:DPO 及其家族#
直接偏好优化(Direct Preference Optimization, DPO)依据一条数学恒等式证明语言模型本身即是一个隐式的奖励模型,从而把 RLHF 中训练奖励模型 + 运行 PPO的两阶段流程,归并为一个形如逻辑回归的分类损失,直接在偏好对上优化策略。
直接偏好优化(Direct Preference Optimization, DPO)依据一条数学恒等式证明语言模型本身即是一个隐式的奖励模型,从而把 RLHF 中训练奖励模型 + 运行 PPO的两阶段流程,归并为一个形如逻辑回归的分类损失,直接在偏好对上优化策略。