31.2 SFT 与强化学习后训练实战#
把一个开源基座模型,先用监督微调(SFT)变成会听指令的助手,再用强化学习(DPO / PPO / GRPO)做偏好对齐或"推理 RL",直至能低成本复现 DeepSeek-R1 式的"顿悟",这是当前最前沿、最能出成果的实战方向。
把一个开源基座模型,先用监督微调(SFT)变成会听指令的助手,再用强化学习(DPO / PPO / GRPO)做偏好对齐或"推理 RL",直至能低成本复现 DeepSeek-R1 式的"顿悟",这是当前最前沿、最能出成果的实战方向。