MuZero:学习用于规划的模型
MuZero 学习一个只预测奖励、价值与策略的隐空间动力学,无需已知规则,在 Atari 与棋类上同时达到顶尖。本章讲其表示/动力学/预测三网络、训练目标,以及 Stochastic MuZero、EfficientZero 等扩展。
- 模型只需在”对决策有用”的意义上正确
- 价值等价(value equivalence)原理
- EfficientZero 在 Atari 100k 上的样本效率
MuZero 学习一个只预测奖励、价值与策略的隐空间动力学,无需已知规则,在 Atari 与棋类上同时达到顶尖。本章讲其表示/动力学/预测三网络、训练目标,以及 Stochastic MuZero、EfficientZero 等扩展。