跳转到内容

第八卷 · 多智能体与博弈

多个学习者同时改变环境时,平稳性假设失效,“最优”也要重新定义。本卷从博弈论的均衡概念出发讲多智能体 RL。

  • 第一部分 · 多智能体 RL:MARL 基础与集中训练分散执行、通信与协作。
  • 第二部分 · 博弈与均衡:均衡概念、自博弈与 PSRO。

第四卷。