跳转到内容
强化学习百科
搜索
Ctrl
K
取消
选择主题
深色
浅色
自动
第一卷 · 基础与问题设定
第二卷 · 表格方法与动态规划
第三卷 · 值函数方法
第四卷 · 策略梯度与 Actor-Critic
第五卷 · 基于模型的 RL 与规划
第六卷 · 探索与内在动机
第七卷 · 离线 RL 与模仿学习
第八卷 · 多智能体与博弈
第九卷 · RL 与大语言模型
第十卷 · 分层、目标与元学习
第十一卷 · 工程与系统
第十二卷 · 应用
术语表
参考文献与延伸阅读
术语表
术语表
优势函数 Advantage
Bellman 方程
致命三要素 Deadly Triad
经验回放 Experience Replay
可利用性 Exploitability
GRPO
事后经验回放 HER
KL 惩罚 / 信任域
马尔可夫决策过程 MDP
On-policy / Off-policy
奖励黑客 Reward Hacking
选择主题
深色
浅色
自动
术语表
›
术语表
›
经验回放 Experience Replay
经验回放 Experience Replay
定义
:打破样本相关性、提高样本效率,是 off-policy 深度 RL 的标配。
出处
:
DQN 及其改进
。