第七卷 · 离线 RL 与模仿学习
当不能与环境交互、只能从固定数据集学习时,RL 的核心困难变成分布偏移。本卷从模仿学习讲到离线 RL,再到把 RL 当序列建模。
- 第一部分 · 模仿学习:行为克隆与 DAgger、逆强化学习与 GAIL。
- 第二部分 · 离线 RL:分布偏移与保守估计:CQL、IQL、决策 Transformer 与序列建模、离线 RL 基准与评估。
第三、四卷。
当不能与环境交互、只能从固定数据集学习时,RL 的核心困难变成分布偏移。本卷从模仿学习讲到离线 RL,再到把 RL 当序列建模。
第三、四卷。