决策 Transformer 与序列建模
决策 Transformer 以目标回报为条件、用 Transformer 自回归预测动作,把离线 RL 变成序列建模。本章讲其优势(无自举、无不稳定)、局限(无法”缝合”次优轨迹),以及 Trajectory Transformer、Q-Transformer 等后续。
- 回报条件化在随机环境中有理论缺陷
- 缝合能力是 TD 方法相对 DT 的优势
- 与大模型范式天然兼容
决策 Transformer 以目标回报为条件、用 Transformer 自回归预测动作,把离线 RL 变成序列建模。本章讲其优势(无自举、无不稳定)、局限(无法”缝合”次优轨迹),以及 Trajectory Transformer、Q-Transformer 等后续。