里程碑:从 TD-Gammon 到 AlphaStar
TD-Gammon、Atari DQN、AlphaGo/AlphaZero、OpenAI Five、AlphaStar、MuZero、ChatGPT(RLHF)、DeepSeek-R1。本章复盘每个里程碑的技术关键、算力规模,以及哪些方法被后续沿用。
- 自博弈 + 搜索的组合被反复验证
- 大规模并行采样是多个里程碑的共同基础
- RLHF 与 RLVR 让 RL 走出游戏
TD-Gammon、Atari DQN、AlphaGo/AlphaZero、OpenAI Five、AlphaStar、MuZero、ChatGPT(RLHF)、DeepSeek-R1。本章复盘每个里程碑的技术关键、算力规模,以及哪些方法被后续沿用。