价值函数与 Bellman 方程
状态价值 与动作价值 满足 Bellman 期望方程,最优价值满足 Bellman 最优方程。本章推导这两组方程,说明它们为何是压缩映射,以及”策略评估 + 策略改进”这一贯穿全书的模式。
- Bellman 算子是 -压缩,迭代必收敛(表格情形)
- 优势函数 是策略梯度的核心量
状态价值 与动作价值 满足 Bellman 期望方程,最优价值满足 Bellman 最优方程。本章推导这两组方程,说明它们为何是压缩映射,以及”策略评估 + 策略改进”这一贯穿全书的模式。