跳转到内容

第二卷 · 表格方法与动态规划

在状态可枚举的世界里,RL 的核心思想可以被完整、严格地理解。本卷是深度 RL 各卷的”无近似版本”。

  • 第一部分 · 动态规划:策略迭代与值迭代。
  • 第二部分 · 无模型学习:蒙特卡洛方法、时序差分:TD(0)、SARSA 与 Q-learning、多臂老虎机。

第一卷第一部分。