奖励黑客与对齐税
策略会找到奖励模型的漏洞:冗长、谄媚、格式游戏、在可验证任务中的作弊。本章整理已观察到的奖励黑客类型、检测方法、以及 KL 约束、奖励集成、奖励模型迭代等缓解手段;并讨论 RL 微调对基础能力的影响(对齐税)。
- 长度偏差是最常见的奖励黑客
- 奖励过优化随 KL 增大呈现先升后降
- 对齐税可通过混合预训练数据缓解
策略会找到奖励模型的漏洞:冗长、谄媚、格式游戏、在可验证任务中的作弊。本章整理已观察到的奖励黑客类型、检测方法、以及 KL 约束、奖励集成、奖励模型迭代等缓解手段;并讨论 RL 微调对基础能力的影响(对齐税)。