跳转到内容

模型误差、利用与不确定性

优化器会利用模型的错误(model exploitation)找到现实中不存在的高回报。本章讨论不确定性估计(集成、贝叶斯)、悲观规划、以及在离线设定下模型方法的保守化(MOPO、MOReL)。

  • 模型误差随 rollout 长度复合增长
  • 用不确定性惩罚奖励是通用手段
  • 离线 + 模型 = 双重分布偏移