跳转到内容

MARL 基础与集中训练分散执行

其他智能体在学习,环境从单个智能体看是非平稳的;团队奖励下每个智能体的贡献难以分辨。CTDE 在训练时使用全局信息、执行时只用局部观测。本章讲 MADDPG、MAPPO、QMIX 与价值分解。

  • 独立学习(IPPO)是意外强大的基线
  • QMIX 的单调性约束限制了可表示的联合价值
  • MAPPO 在合作任务上常优于 off-policy 方法