跳转到内容

里程碑:从 TD-Gammon 到 AlphaStar

TD-Gammon、Atari DQN、AlphaGo/AlphaZero、OpenAI Five、AlphaStar、MuZero、ChatGPT(RLHF)、DeepSeek-R1。本章复盘每个里程碑的技术关键、算力规模,以及哪些方法被后续沿用。

  • 自博弈 + 搜索的组合被反复验证
  • 大规模并行采样是多个里程碑的共同基础
  • RLHF 与 RLVR 让 RL 走出游戏