← 返回更多项目
组合优化学习实践

强化学习求解旅行商问题

组合优化环境中的路线学习

通过自定义 TSP 环境、DQN 训练代码与基线求解脚本,探索旅行商问题的学习式求解。

项目角色

算法实现与实验探索

主要方法

DQN · TSP · 组合优化

25 节点实验:DQN 路径与参考最优路径的原始对比图。
25 节点实验:DQN 路径与参考最优路径的原始对比图。 查看原尺寸图示

研究问题

路线优化为研究约束下的序贯决策提供了具体场景。我将城市选择构造为强化学习任务,实现环境与 DQN 组件,连接移动代价、动作选择和策略更新。

我的贡献

  • 实现自定义 Gym 环境,跟踪当前城市、访问标记和累计距离。
  • 将 PyTorch Q 网络、经验回放、ε-greedy 探索和周期同步的目标网络接入训练循环。
  • 准备动态规划与 LKH 求解脚本,探索学习方法与传统优化方法之间的比较。

技术路线

  • 通过当前城市、访问历史和累计距离表示路线构造过程,在每个决策步选择下一个城市。
  • 以欧氏移动距离的负值作为逐步奖励,对重复访问施加惩罚,将优化目标转化为学习信号。
  • 从回放样本中通过时序差分损失学习 Q 值,周期更新目标网络,并结合动态规划和 LKH 工具检查路线。

成果与发现

  • 完成从问题建模、环境实现、DQN 训练到路线检查的学习式求解流程。
  • 将组合优化与强化学习组件结合,为分析状态和奖励设计如何影响序贯选择提供了可操作的实验场景。

保持联系

欢迎通过邮件交流研究想法、项目经历与潜在合作。