跳转到内容
强化学习百科
搜索
Ctrl
K
取消
选择主题
深色
浅色
自动
第一卷 · 基础与问题设定
第二卷 · 表格方法与动态规划
第三卷 · 值函数方法
第四卷 · 策略梯度与 Actor-Critic
第五卷 · 基于模型的 RL 与规划
第六卷 · 探索与内在动机
第七卷 · 离线 RL 与模仿学习
第八卷 · 多智能体与博弈
第九卷 · RL 与大语言模型
第十卷 · 分层、目标与元学习
第十一卷 · 工程与系统
第十二卷 · 应用
术语表
参考文献与延伸阅读
导读
第一部分 · 分层与目标
选项框架与技能发现
目标条件 RL 与 HER
第二部分 · 元学习与泛化
元强化学习
泛化、过拟合与 Sim-to-Real
选择主题
深色
浅色
自动
第十卷 · 分层、目标与元学习
›
第二部分 · 元学习与泛化
›
泛化、过拟合与 Sim-to-Real
泛化、过拟合与 Sim-to-Real
RL 策略对训练环境严重过拟合(ProcGen 基准)。本章讨论程序化生成、数据增强、领域随机化在模拟到现实迁移中的作用,以及泛化差距的度量。
本章要点
Section titled “本章要点”
训练关卡数量对泛化的影响呈幂律
领域随机化以牺牲单环境性能换鲁棒性
视觉增强(随机裁剪)对像素输入 RL 效果显著
相关阅读
Section titled “相关阅读”
机器人