跳转到内容

行为克隆与 DAgger

行为克隆把模仿当作监督学习,但误差沿轨迹复合,偏离专家分布后无法恢复。DAgger 通过在学习者的状态分布上查询专家修复这一点。本章分析复合误差的 O(T2)O(T^2) 界与 DAgger 的 O(T)O(T) 改进。

  • BC 在数据充足、任务简单时依然是强基线
  • DAgger 需要可交互的专家
  • 大规模 BC(机器人基础模型)重新流行