跳转到内容

第十二卷 · 应用

本卷按领域整理 RL 的落地方式:问题如何被建模成 MDP、哪些方法真正有效、以及各领域特有的陷阱。

  • 第一部分 · 领域:机器人、推荐与广告、组合优化与调度、金融交易中的 RL。
  • 第二部分 · 里程碑复盘:里程碑:从 TD-Gammon 到 AlphaStar。

第四、七卷。