MCTS 与 AlphaZero
蒙特卡洛树搜索用 UCT 平衡探索利用;AlphaZero 用神经网络的策略与价值引导搜索,再用搜索结果训练网络。本章讲 PUCT、自博弈训练循环,以及”搜索 = 策略改进、训练 = 策略评估”的 GPI 解读。
- 搜索输出的动作分布比原始策略更好,成为训练目标
- 价值网络代替 rollout 评估叶节点
- 完全信息、确定性、已知规则是前提
蒙特卡洛树搜索用 UCT 平衡探索利用;AlphaZero 用神经网络的策略与价值引导搜索,再用搜索结果训练网络。本章讲 PUCT、自博弈训练循环,以及”搜索 = 策略改进、训练 = 策略评估”的 GPI 解读。