时序差分:TD(0)、SARSA 与 Q-learning
TD 用 作为目标,结合了 DP 的自举与 MC 的采样。SARSA 是 on-policy 控制,Q-learning 是 off-policy 控制。本章比较两者的行为差异(悬崖行走),并介绍 TD(λ) 与资格迹。
- TD 有偏但低方差,可在线更新
- Q-learning 学最优策略但执行时可能更危险
- λ 在 MC(λ=1)与 TD(0) 之间插值
TD 用 作为目标,结合了 DP 的自举与 MC 的采样。SARSA 是 on-policy 控制,Q-learning 是 off-policy 控制。本章比较两者的行为差异(悬崖行走),并介绍 TD(λ) 与资格迹。