跳转到内容

奖励黑客与对齐税

策略会找到奖励模型的漏洞:冗长、谄媚、格式游戏、在可验证任务中的作弊。本章整理已观察到的奖励黑客类型、检测方法、以及 KL 约束、奖励集成、奖励模型迭代等缓解手段;并讨论 RL 微调对基础能力的影响(对齐税)。

  • 长度偏差是最常见的奖励黑客
  • 奖励过优化随 KL 增大呈现先升后降
  • 对齐税可通过混合预训练数据缓解