策略梯度定理给出 ∇J=E[∇logπ(a∣s) Qπ(s,a)]\nabla J = \mathbb{E}[\nabla \log \pi(a|s) \, Q^\pi(s,a)]∇J=E[∇logπ(a∣s)Qπ(s,a)]。本章推导该定理、REINFORCE 算法、基线(baseline)为何不引入偏差却降低方差,以及因果性(reward-to-go)的作用。