跳转到内容

逆强化学习与 GAIL

逆 RL 假设专家最优,推断能解释其行为的奖励函数;最大熵 IRL 解决歧义性;GAIL 用判别器直接匹配占用度量,绕过显式奖励。本章讲这条脉络及其与 GAN 的对应关系。

  • 奖励比策略更可迁移
  • GAIL 的对抗训练不稳定
  • RLHF 的奖励模型可视为 IRL 的偏好版本