跳转到内容

第六卷 · 探索与内在动机

稀疏奖励环境中,随机探索的期望时间是指数级的。本卷系统整理”让智能体自己想去看看”的方法。

  • 第一部分 · 内在奖励:计数与伪计数探索、好奇心与预测误差:ICM 与 RND、信息增益与贝叶斯探索。
  • 第二部分 · 结构化探索:Go-Explore 与归档式探索、目标导向的探索。

第一卷第一部分;第三卷。