跳转到内容
强化学习百科
搜索
Ctrl
K
取消
选择主题
深色
浅色
自动
第一卷 · 基础与问题设定
第二卷 · 表格方法与动态规划
第三卷 · 值函数方法
第四卷 · 策略梯度与 Actor-Critic
第五卷 · 基于模型的 RL 与规划
第六卷 · 探索与内在动机
第七卷 · 离线 RL 与模仿学习
第八卷 · 多智能体与博弈
第九卷 · RL 与大语言模型
第十卷 · 分层、目标与元学习
第十一卷 · 工程与系统
第十二卷 · 应用
术语表
参考文献与延伸阅读
导读
第一部分 · 领域
机器人
推荐与广告
组合优化与调度
金融交易中的 RL
第二部分 · 里程碑复盘
里程碑:从 TD-Gammon 到 AlphaStar
选择主题
深色
浅色
自动
第十二卷 · 应用
›
第一部分 · 领域
›
推荐与广告
推荐与广告
推荐系统中的 RL 多以上下文老虎机形式出现;长期用户价值优化需要完整 RL,但只能离线学习。本章讲 slate 推荐的动作空间问题、离线策略评估(IPS、DR)、以及工业界的实际部署经验。
本章要点
Section titled “本章要点”
探索的代价在真实流量上非常昂贵
离线评估的方差是主要障碍
长期价值与短期指标的冲突
相关阅读
Section titled “相关阅读”
多臂老虎机