Go-Explore 与归档式探索
Go-Explore 把探索拆成两阶段:维护已到达状态的归档,选择有希望的状态、确定性地返回、再从那里随机探索;随后用模仿学习使策略鲁棒。本章讲其设计动机(分离”回去”与”探索”)、对可重置环境的依赖,以及后续的策略化版本。
- 解决了”绕路”(detachment)与”脱轨”(derailment)两个探索失败模式
- 在 Montezuma 与 Pitfall 上超越人类
- 归档的状态表示(cell)设计是关键
Go-Explore 把探索拆成两阶段:维护已到达状态的归档,选择有希望的状态、确定性地返回、再从那里随机探索;随后用模仿学习使策略鲁棒。本章讲其设计动机(分离”回去”与”探索”)、对可重置环境的依赖,以及后续的策略化版本。