行为克隆把模仿当作监督学习,但误差沿轨迹复合,偏离专家分布后无法恢复。DAgger 通过在学习者的状态分布上查询专家修复这一点。本章分析复合误差的 O(T2)O(T^2)O(T2) 界与 DAgger 的 O(T)O(T)O(T) 改进。