跳转到内容

探索与利用

数据由策略自己产生,不探索就永远看不到更好的动作。本章介绍 ϵ\epsilon-greedy、乐观初始化、UCB 与 Thompson 采样的直觉,并说明为什么深度 RL 中的探索远比表格情形困难。

  • 探索的代价是短期回报,收益是信息
  • 简单的 ϵ\epsilon-greedy 在稀疏奖励下几乎无效
  • 第六卷专门讨论深度 RL 中的探索