跳转到内容

第一卷 · 基础与问题设定

强化学习的所有算法都是对同一个问题的不同解法:在未知环境中通过交互最大化累积回报。本卷把这个问题写清楚,并约定全书的记号与评估方式。

  • 第一部分 · 问题设定:马尔可夫决策过程、价值函数与 Bellman 方程、探索与利用。
  • 第二部分 · 方法论:评估协议与可复现性、算法地图。

概率论与线性代数基础。