跳转到内容
强化学习百科
搜索
Ctrl
K
取消
选择主题
深色
浅色
自动
第一卷 · 基础与问题设定
第二卷 · 表格方法与动态规划
第三卷 · 值函数方法
第四卷 · 策略梯度与 Actor-Critic
第五卷 · 基于模型的 RL 与规划
第六卷 · 探索与内在动机
第七卷 · 离线 RL 与模仿学习
第八卷 · 多智能体与博弈
第九卷 · RL 与大语言模型
第十卷 · 分层、目标与元学习
第十一卷 · 工程与系统
第十二卷 · 应用
术语表
参考文献与延伸阅读
导读
第一部分 · On-policy 方法
策略梯度定理与 REINFORCE
Actor-Critic 与 GAE
TRPO 与 PPO
第二部分 · 连续控制
DDPG、TD3 与 SAC
策略梯度的理论问题
选择主题
深色
浅色
自动
第四卷 · 策略梯度与 Actor-Critic
›
第二部分 · 连续控制
›
策略梯度的理论问题
策略梯度的理论问题
策略梯度在 softmax 参数化下的收敛速度、初始化导致的平坦区(plateau)、熵正则化对优化景观的改善。本章综述近年的理论进展及其对实践的启示。
本章要点
Section titled “本章要点”
熵正则化使目标更”凸”
自然梯度对参数化不变
理论结果多在表格或线性设定下