评估协议与可复现性
RL 实验对随机种子、实现细节、超参极其敏感,同一算法在不同代码库中的表现差异可以超过算法之间的差异。本章给出报告结果的规范(多种子、置信区间、IQM)、常用基准套件,以及”代码级优化”对结论的影响。
- 至少 5–10 个种子并报告区间,而不是最好的一次
- Agarwal et al. (2021) 建议用 IQM 与性能曲线
- PPO 的 37 个实现细节
RL 实验对随机种子、实现细节、超参极其敏感,同一算法在不同代码库中的表现差异可以超过算法之间的差异。本章给出报告结果的规范(多种子、置信区间、IQM)、常用基准套件,以及”代码级优化”对结论的影响。