跳转到内容

分布偏移与保守估计:CQL、IQL

离线 Q-learning 会高估数据集中未出现的动作。CQL 显式压低这些动作的 Q 值;IQL 用期望回归只在数据集内动作上做改进,避免查询 OOD 动作。本章比较策略约束、价值正则、隐式改进三类思路。

  • 离线 RL 是致命三要素的最坏情况
  • IQL 简单稳定,是常用基线
  • 离线到在线微调的衔接问题