跳转到内容

信息增益与贝叶斯探索

VIME 等方法用对动力学模型参数的信息增益作为奖励;后验采样(PSRL)在每回合采样一个 MDP 并对其最优行动,是 Thompson 采样在 RL 中的推广。本章讲这些方法的理论优雅与工程代价。

  • 信息增益是原则性的但计算昂贵
  • PSRL 的贝叶斯遗憾界
  • Bootstrapped DQN 用集成近似后验