跳转到内容

时序差分:TD(0)、SARSA 与 Q-learning

TD 用 r+γV(s)r + \gamma V(s') 作为目标,结合了 DP 的自举与 MC 的采样。SARSA 是 on-policy 控制,Q-learning 是 off-policy 控制。本章比较两者的行为差异(悬崖行走),并介绍 TD(λ) 与资格迹。

  • TD 有偏但低方差,可在线更新
  • Q-learning 学最优策略但执行时可能更危险
  • λ 在 MC(λ=1)与 TD(0) 之间插值