Dyna 与模型预测控制
Dyna 用学到的模型生成虚拟经验来更新价值函数;MPC 在每一步用模型向前滚动、优化短期动作序列。本章比较两者以及 PETS、MBPO 等现代变体中”短 rollout + 集成模型”的设计原则。
- 短 rollout 限制模型误差的累积
- 概率集成模型刻画不确定性
- MBPO 的理论:模型误差与 rollout 长度的权衡
Dyna 用学到的模型生成虚拟经验来更新价值函数;MPC 在每一步用模型向前滚动、优化短期动作序列。本章比较两者以及 PETS、MBPO 等现代变体中”短 rollout + 集成模型”的设计原则。