跳转到内容

价值函数与 Bellman 方程

状态价值 VπV^\pi 与动作价值 QπQ^\pi 满足 Bellman 期望方程,最优价值满足 Bellman 最优方程。本章推导这两组方程,说明它们为何是压缩映射,以及”策略评估 + 策略改进”这一贯穿全书的模式。

  • Q(s,a)=E[r+γmaxaQ(s,a)]Q^*(s,a) = \mathbb{E}[r + \gamma \max_{a'} Q^*(s',a')]
  • Bellman 算子是 γ\gamma-压缩,迭代必收敛(表格情形)
  • 优势函数 A=QVA = Q - V 是策略梯度的核心量