算法地图
价值方法学 ,策略方法学 ,基于模型的方法学 与 ;在线 vs 离线、on-policy vs off-policy 是另外两个正交维度。本章给出全书各卷在这张地图上的位置。
- on/off-policy 决定能否复用旧数据
- 基于模型与无模型的分界在于是否显式学习环境
- 现代方法常是混合:Actor-Critic、MuZero、DreamerV3
价值方法学 ,策略方法学 ,基于模型的方法学 与 ;在线 vs 离线、on-policy vs off-policy 是另外两个正交维度。本章给出全书各卷在这张地图上的位置。