跳转到内容
- Mnih et al. (2015) DQN;Hessel et al. (2018) Rainbow(→ 第三卷)
- Schulman et al. (2015) TRPO;(2016) GAE;(2017) PPO(→ 第四卷)
- Haarnoja et al. (2018) SAC;Fujimoto et al. (2018) TD3(→ 第四卷)
- Silver et al. (2016, 2017) AlphaGo / AlphaZero;Schrittwieser et al. (2020) MuZero;Hafner et al. (2023) DreamerV3(→ 第五卷)
- Bellemare et al. (2016) 伪计数;Burda et al. (2018) RND;Ecoffet et al. (2021) Go-Explore(→ 第六卷)
- Kumar et al. (2020) CQL;Kostrikov et al. (2021) IQL;Chen et al. (2021) Decision Transformer(→ 第七卷)
- Ouyang et al. (2022) InstructGPT;Rafailov et al. (2023) DPO;Shao et al. (2024) GRPO / DeepSeekMath;DeepSeek-R1 (2025)(→ 第九卷)
- Andrychowicz et al. (2017) HER;Duan et al. (2016) RL²(→ 第十卷)
- Espeholt et al. (2018) IMPALA;Horgan et al. (2018) Ape-X(→ 第十一卷)
- Agarwal et al. (2021) “Deep RL at the Edge of the Statistical Precipice”(→ 第一卷评估)