跳转到内容

马尔可夫决策过程

MDP 是 RL 的标准形式化:(S,A,P,R,γ)(\mathcal{S}, \mathcal{A}, P, R, \gamma)。本章定义策略、回报、轨迹,讨论折扣因子的双重角色(数学收敛与偏好近期),以及部分可观测(POMDP)时问题如何变难。

  • 折扣 γ\gamma 决定有效视野约 1/(1γ)1/(1-\gamma)
  • 马尔可夫性是对状态表示的要求,不是对世界的要求
  • POMDP 下最优策略需要依赖历史或信念状态