跳转到内容
强化学习百科
搜索
Ctrl
K
取消
选择主题
深色
浅色
自动
第一卷 · 基础与问题设定
第二卷 · 表格方法与动态规划
第三卷 · 值函数方法
第四卷 · 策略梯度与 Actor-Critic
第五卷 · 基于模型的 RL 与规划
第六卷 · 探索与内在动机
第七卷 · 离线 RL 与模仿学习
第八卷 · 多智能体与博弈
第九卷 · RL 与大语言模型
第十卷 · 分层、目标与元学习
第十一卷 · 工程与系统
第十二卷 · 应用
术语表
参考文献与延伸阅读
导读
第一部分 · 动态规划
策略迭代与值迭代
第二部分 · 无模型学习
蒙特卡洛方法
时序差分:TD(0)、SARSA 与 Q-learning
多臂老虎机
选择主题
深色
浅色
自动
第二卷 · 表格方法与动态规划
›
第二部分 · 无模型学习
›
多臂老虎机
多臂老虎机
老虎机是探索问题的最纯净形式。本章介绍
ϵ
\epsilon
ϵ
-greedy、UCB1、Thompson 采样及其遗憾界,上下文老虎机与推荐系统的联系,以及它作为 RLHF 中偏好学习基础的角色。
本章要点
Section titled “本章要点”
UCB 的遗憾为
O
(
log
T
)
O(\log T)
O
(
lo
g
T
)
Thompson 采样在实践中常优于 UCB
上下文老虎机是推荐/广告的主力模型
相关阅读
Section titled “相关阅读”
推荐与广告