跳转到内容

策略梯度定理与 REINFORCE

策略梯度定理给出 J=E[logπ(as)Qπ(s,a)]\nabla J = \mathbb{E}[\nabla \log \pi(a|s) \, Q^\pi(s,a)]。本章推导该定理、REINFORCE 算法、基线(baseline)为何不引入偏差却降低方差,以及因果性(reward-to-go)的作用。

  • 对数导数技巧把对分布的导数变成期望
  • 基线可以是任意只依赖状态的函数
  • 方差是策略梯度的核心敌人