跳转到内容

第七卷 · 离线 RL 与模仿学习

当不能与环境交互、只能从固定数据集学习时,RL 的核心困难变成分布偏移。本卷从模仿学习讲到离线 RL,再到把 RL 当序列建模。

  • 第一部分 · 模仿学习:行为克隆与 DAgger、逆强化学习与 GAIL。
  • 第二部分 · 离线 RL:分布偏移与保守估计:CQL、IQL、决策 Transformer 与序列建模、离线 RL 基准与评估。

第三、四卷。