跳转到内容
强化学习百科
搜索
Ctrl
K
取消
选择主题
深色
浅色
自动
第一卷 · 基础与问题设定
第二卷 · 表格方法与动态规划
第三卷 · 值函数方法
第四卷 · 策略梯度与 Actor-Critic
第五卷 · 基于模型的 RL 与规划
第六卷 · 探索与内在动机
第七卷 · 离线 RL 与模仿学习
第八卷 · 多智能体与博弈
第九卷 · RL 与大语言模型
第十卷 · 分层、目标与元学习
第十一卷 · 工程与系统
第十二卷 · 应用
术语表
参考文献与延伸阅读
导读
第一部分 · 模仿学习
行为克隆与 DAgger
逆强化学习与 GAIL
第二部分 · 离线 RL
分布偏移与保守估计:CQL、IQL
决策 Transformer 与序列建模
离线 RL 基准与评估
选择主题
深色
浅色
自动
第七卷 · 离线 RL 与模仿学习
›
第一部分 · 模仿学习
›
逆强化学习与 GAIL
逆强化学习与 GAIL
逆 RL 假设专家最优,推断能解释其行为的奖励函数;最大熵 IRL 解决歧义性;GAIL 用判别器直接匹配占用度量,绕过显式奖励。本章讲这条脉络及其与 GAN 的对应关系。
本章要点
Section titled “本章要点”
奖励比策略更可迁移
GAIL 的对抗训练不稳定
RLHF 的奖励模型可视为 IRL 的偏好版本
相关阅读
Section titled “相关阅读”
奖励模型