7.5 可验证奖励与推理 RL:GRPO 与 DeepSeek-R1#

当奖励可由程序确定性地判定对错,而非由人工评分或偏好模型近似给出时,强化学习即可采用一种删去价值网络、仅依赖组内相对比较的算法,GRPO,将大模型的长链推理从预训练能力中激发出来,这正是 DeepSeek-R1 出现自我反思行为的技术基础。

登录后才可看