跳转到内容

超参数、稳定性与调试清单

RL 调试的顺序:环境是否正确 → 奖励尺度 → 观测归一化 → 优势/回报计算 → 学习率与裁剪 → 网络初始化。本章给出一份可执行的清单、应监控的诊断量(熵、KL、解释方差、梯度范数),以及常见症状对应的原因。

  • 先在最简单的环境(CartPole)上验证实现
  • 解释方差接近 0 或负值说明价值网络没学到
  • 熵坍缩过快是最常见的失败模式