第三卷 · 值函数方法
把表格换成神经网络之后,Q-learning 从”必然收敛”变成”经常发散”。本卷讲 DQN 为何能工作、后续改进各自解决了什么问题。
- 第一部分 · DQN 家族:DQN 及其改进、分布式 RL:C51、QR-DQN 与 IQN。
- 第二部分 · 理论与陷阱:致命三要素、连续动作空间的值方法。
第二卷第二部分;深度学习基础。
把表格换成神经网络之后,Q-learning 从”必然收敛”变成”经常发散”。本卷讲 DQN 为何能工作、后续改进各自解决了什么问题。
第二卷第二部分;深度学习基础。