跳转到内容
强化学习百科
搜索
Ctrl
K
取消
选择主题
深色
浅色
自动
第一卷 · 基础与问题设定
第二卷 · 表格方法与动态规划
第三卷 · 值函数方法
第四卷 · 策略梯度与 Actor-Critic
第五卷 · 基于模型的 RL 与规划
第六卷 · 探索与内在动机
第七卷 · 离线 RL 与模仿学习
第八卷 · 多智能体与博弈
第九卷 · RL 与大语言模型
第十卷 · 分层、目标与元学习
第十一卷 · 工程与系统
第十二卷 · 应用
术语表
参考文献与延伸阅读
导读
第一部分 · 多智能体 RL
MARL 基础与集中训练分散执行
通信与协作
第二部分 · 博弈与均衡
均衡概念
自博弈与 PSRO
选择主题
深色
浅色
自动
第八卷 · 多智能体与博弈
›
第二部分 · 博弈与均衡
›
自博弈与 PSRO
自博弈与 PSRO
朴素自博弈可能循环(石头剪刀布)。虚构自博弈对历史平均策略最优响应;PSRO 把对手池当作元博弈、用元求解器选择混合。本章讲 AlphaStar 的联赛训练与 CFR 在扑克中的成功。
本章要点
Section titled “本章要点”
对手多样性是避免循环的关键
CFR 系列在不完全信息博弈中占主导
联赛训练中的”剥削者”角色
相关阅读
Section titled “相关阅读”
MCTS 与 AlphaZero