跳转到内容
强化学习百科
搜索
Ctrl
K
取消
选择主题
深色
浅色
自动
第一卷 · 基础与问题设定
第二卷 · 表格方法与动态规划
第三卷 · 值函数方法
第四卷 · 策略梯度与 Actor-Critic
第五卷 · 基于模型的 RL 与规划
第六卷 · 探索与内在动机
第七卷 · 离线 RL 与模仿学习
第八卷 · 多智能体与博弈
第九卷 · RL 与大语言模型
第十卷 · 分层、目标与元学习
第十一卷 · 工程与系统
第十二卷 · 应用
术语表
参考文献与延伸阅读
导读
第一部分 · 内在奖励
计数与伪计数探索
好奇心与预测误差:ICM 与 RND
信息增益与贝叶斯探索
第二部分 · 结构化探索
Go-Explore 与归档式探索
目标导向的探索
选择主题
深色
浅色
自动
第六卷 · 探索与内在动机
第六卷 · 探索与内在动机
稀疏奖励环境中,随机探索的期望时间是指数级的。本卷系统整理”让智能体自己想去看看”的方法。
本卷结构
Section titled “本卷结构”
第一部分 · 内在奖励
:计数与伪计数探索、好奇心与预测误差:ICM 与 RND、信息增益与贝叶斯探索。
第二部分 · 结构化探索
:Go-Explore 与归档式探索、目标导向的探索。
前置
Section titled “前置”
第一卷第一部分;第三卷。