第九卷 · RL 与大语言模型
RLHF 让 RL 成为大模型时代最重要的后训练技术。本卷从偏好数据讲到推理模型的可验证奖励训练,重点是”哪些经典 RL 结论在这里仍然成立、哪些被改写了”。
- 第一部分 · RLHF:RLHF 全流程、奖励模型、PPO for LLM。
- 第二部分 · PPO 之后:DPO 与无奖励模型方法、GRPO 与可验证奖励:推理模型的训练、奖励黑客与对齐税。
第四卷第一部分;语言模型基础。
RLHF 让 RL 成为大模型时代最重要的后训练技术。本卷从偏好数据讲到推理模型的可验证奖励训练,重点是”哪些经典 RL 结论在这里仍然成立、哪些被改写了”。
第四卷第一部分;语言模型基础。