跳转到内容
强化学习百科
搜索
Ctrl
K
取消
选择主题
深色
浅色
自动
第一卷 · 基础与问题设定
第二卷 · 表格方法与动态规划
第三卷 · 值函数方法
第四卷 · 策略梯度与 Actor-Critic
第五卷 · 基于模型的 RL 与规划
第六卷 · 探索与内在动机
第七卷 · 离线 RL 与模仿学习
第八卷 · 多智能体与博弈
第九卷 · RL 与大语言模型
第十卷 · 分层、目标与元学习
第十一卷 · 工程与系统
第十二卷 · 应用
术语表
参考文献与延伸阅读
导读
第一部分 · DQN 家族
DQN 及其改进
分布式 RL:C51、QR-DQN 与 IQN
第二部分 · 理论与陷阱
致命三要素
连续动作空间的值方法
选择主题
深色
浅色
自动
第三卷 · 值函数方法
›
第二部分 · 理论与陷阱
›
致命三要素
致命三要素
三者同时出现时,即使线性函数逼近的 TD 也可能发散(Baird 反例)。本章解释发散机制、为什么 DQN 在实践中通常没事、以及 Gradient TD、目标网络、正则化等缓解手段。
本章要点
Section titled “本章要点”
三者缺一即可保证收敛(线性情形)
目标网络相当于减慢自举
离线 RL 是致命三要素最严重的场景
相关阅读
Section titled “相关阅读”
分布偏移与保守估计