7.7 OPD:On-Policy Distillation 同策略蒸馏#

同策略蒸馏让学生按当前策略生成轨迹,再让教师在学生实际访问的每个前缀上给出逐 token 分布。它以 RL 的状态覆盖取得 KD 的密集监督,直接修复离线蒸馏的训练与推理状态错位;主要取舍是持续承担教师评分成本,并控制轨迹陈旧、长度膨胀与截断偏差。

登录后才可看