跳转到内容

MCTS 与 AlphaZero

蒙特卡洛树搜索用 UCT 平衡探索利用;AlphaZero 用神经网络的策略与价值引导搜索,再用搜索结果训练网络。本章讲 PUCT、自博弈训练循环,以及”搜索 = 策略改进、训练 = 策略评估”的 GPI 解读。

  • 搜索输出的动作分布比原始策略更好,成为训练目标
  • 价值网络代替 rollout 评估叶节点
  • 完全信息、确定性、已知规则是前提