库与框架对比
单文件实现(CleanRL)适合学习与研究,Stable-Baselines3 适合可靠基线,RLlib 适合大规模分布式,TorchRL 提供可组合原语;LLM 后训练有 TRL、OpenRLHF、veRL 等。本章给出选型建议与各自的坑。
- 单文件实现最容易对照论文核对细节
- LLM 后训练框架的核心是多模型的显存与调度
- 不同库的默认超参差异导致结果不可比
单文件实现(CleanRL)适合学习与研究,Stable-Baselines3 适合可靠基线,RLlib 适合大规模分布式,TorchRL 提供可组合原语;LLM 后训练有 TRL、OpenRLHF、veRL 等。本章给出选型建议与各自的坑。