MDP 是 RL 的标准形式化:(S,A,P,R,γ)(\mathcal{S}, \mathcal{A}, P, R, \gamma)(S,A,P,R,γ)。本章定义策略、回报、轨迹,讨论折扣因子的双重角色(数学收敛与偏好近期),以及部分可观测(POMDP)时问题如何变难。