模型误差、利用与不确定性
优化器会利用模型的错误(model exploitation)找到现实中不存在的高回报。本章讨论不确定性估计(集成、贝叶斯)、悲观规划、以及在离线设定下模型方法的保守化(MOPO、MOReL)。
- 模型误差随 rollout 长度复合增长
- 用不确定性惩罚奖励是通用手段
- 离线 + 模型 = 双重分布偏移
优化器会利用模型的错误(model exploitation)找到现实中不存在的高回报。本章讨论不确定性估计(集成、贝叶斯)、悲观规划、以及在离线设定下模型方法的保守化(MOPO、MOReL)。