跳转到内容

离线 RL 基准与评估

离线 RL 的评估需要与环境交互,而”选超参”本身就违反离线假设。本章讨论 D4RL 各数据集的特点、离线策略评估(OPE)方法,以及公平比较的规范。

  • 在线选超参是常见的隐性作弊
  • OPE 方法(FQE、重要性采样)各有偏差
  • 数据集质量比算法差异更决定结果