7.2 策略梯度:从 REINFORCE 到 Advantage#策略梯度沿提高高回报动作概率的方向更新参数,但其最朴素形式的估计方差过大而难以直接使用;本节论述一条不改变梯度期望、仅降低方差的方法演进链,终点是现代强化学习的枢纽概念优势函数(Advantage)。登录后才可看登录 Satori 账户