跳转到内容

强化学习百科

从试错到最优策略,一座图书馆,而不是一本书
第一卷第一卷 · 基础与问题设定MDP、价值函数与 Bellman 方程、探索与利用、评估协议——全书的公共语言。进入阅读 →第二卷第二卷 · 表格方法与动态规划策略/值迭代、蒙特卡洛、时序差分、Q-learning 与 SARSA、多臂老虎机。进入阅读 →第三卷第三卷 · 值函数方法DQN 及其改进、分布式 RL、函数逼近下的致命三要素。进入阅读 →第四卷第四卷 · 策略梯度与 Actor-CriticREINFORCE 与基线、A2C/A3C、GAE、TRPO/PPO、DDPG/TD3/SAC。进入阅读 →第五卷第五卷 · 基于模型的 RL 与规划Dyna、MCTS 与 AlphaZero、世界模型 Dreamer 与 MuZero、模型误差与规划。进入阅读 →第六卷第六卷 · 探索与内在动机计数与伪计数、好奇心 ICM/RND、信息增益、后验采样与 Go-Explore。进入阅读 →第七卷第七卷 · 离线 RL 与模仿学习行为克隆、逆强化学习、离线 RL(CQL/IQL)、决策 Transformer。进入阅读 →第八卷第八卷 · 多智能体与博弈MARL 基础与 CTDE、自博弈与 PSRO、均衡概念、通信与协作。进入阅读 →第九卷第九卷 · RL 与大语言模型RLHF 全流程、奖励模型、PPO for LLM、DPO 等无奖励模型方法、GRPO 与推理模型、奖励黑客。进入阅读 →第十卷第十卷 · 分层、目标与元学习选项框架、目标条件 RL 与 HER、元 RL、泛化与领域随机化。进入阅读 →第十一卷第十一卷 · 工程与系统环境接口、向量化与分布式采样、超参与稳定性、调试清单、库对比。进入阅读 →第十二卷第十二卷 · 应用机器人、推荐与广告、组合优化与调度、金融交易中的 RL。进入阅读 →术语表术语表横向工具书:所有卷共用的概念索引。进入阅读 →附录参考文献与延伸阅读教材、课程、关键论文、博客与开源库,标注各卷对应章节。进入阅读 →

每卷独立成册,左侧只显示本卷目录;卷与卷之间互相引用。全文搜索覆盖全部卷。