跳转到内容

组合优化与调度

路径规划、芯片布局、数据中心调度、编译器优化等问题用 RL 学习启发式或直接构造解。本章讲指针网络/注意力模型构造解的范式、与传统求解器的结合方式,以及 AlphaDev、芯片布局等案例的实际贡献与争议。

  • RL 通常作为求解器的改进器而非替代品
  • 泛化到更大规模实例是核心难点
  • 基准与比较方法的争议