跳转到内容
强化学习百科
搜索
Ctrl
K
取消
选择主题
深色
浅色
自动
第一卷 · 基础与问题设定
第二卷 · 表格方法与动态规划
第三卷 · 值函数方法
第四卷 · 策略梯度与 Actor-Critic
第五卷 · 基于模型的 RL 与规划
第六卷 · 探索与内在动机
第七卷 · 离线 RL 与模仿学习
第八卷 · 多智能体与博弈
第九卷 · RL 与大语言模型
第十卷 · 分层、目标与元学习
第十一卷 · 工程与系统
第十二卷 · 应用
术语表
参考文献与延伸阅读
导读
第一部分 · 问题设定
马尔可夫决策过程
价值函数与 Bellman 方程
探索与利用
第二部分 · 方法论
评估协议与可复现性
算法地图
选择主题
深色
浅色
自动
第一卷 · 基础与问题设定
›
第一部分 · 问题设定
›
探索与利用
探索与利用
数据由策略自己产生,不探索就永远看不到更好的动作。本章介绍
ϵ
\epsilon
ϵ
-greedy、乐观初始化、UCB 与 Thompson 采样的直觉,并说明为什么深度 RL 中的探索远比表格情形困难。
本章要点
Section titled “本章要点”
探索的代价是短期回报,收益是信息
简单的
ϵ
\epsilon
ϵ
-greedy 在稀疏奖励下几乎无效
第六卷专门讨论深度 RL 中的探索
相关阅读
Section titled “相关阅读”
好奇心与预测误差