跳转到内容

算法地图

价值方法学 QQ,策略方法学 π\pi,基于模型的方法学 PPRR;在线 vs 离线、on-policy vs off-policy 是另外两个正交维度。本章给出全书各卷在这张地图上的位置。

  • on/off-policy 决定能否复用旧数据
  • 基于模型与无模型的分界在于是否显式学习环境
  • 现代方法常是混合:Actor-Critic、MuZero、DreamerV3