信息增益与贝叶斯探索
VIME 等方法用对动力学模型参数的信息增益作为奖励;后验采样(PSRL)在每回合采样一个 MDP 并对其最优行动,是 Thompson 采样在 RL 中的推广。本章讲这些方法的理论优雅与工程代价。
- 信息增益是原则性的但计算昂贵
- PSRL 的贝叶斯遗憾界
- Bootstrapped DQN 用集成近似后验
VIME 等方法用对动力学模型参数的信息增益作为奖励;后验采样(PSRL)在每回合采样一个 MDP 并对其最优行动,是 Thompson 采样在 RL 中的推广。本章讲这些方法的理论优雅与工程代价。