强化学习求解旅行商问题
组合优化环境中的路线学习
通过自定义 TSP 环境、DQN 训练代码与基线求解脚本,探索旅行商问题的学习式求解。
项目角色
算法实现与实验探索
主要方法
DQN · TSP · 组合优化

研究问题
路线优化为研究约束下的序贯决策提供了具体场景。我将城市选择构造为强化学习任务,实现环境与 DQN 组件,连接移动代价、动作选择和策略更新。
我的贡献
- 实现自定义 Gym 环境,跟踪当前城市、访问标记和累计距离。
- 将 PyTorch Q 网络、经验回放、ε-greedy 探索和周期同步的目标网络接入训练循环。
- 准备动态规划与 LKH 求解脚本,探索学习方法与传统优化方法之间的比较。
技术路线
- 通过当前城市、访问历史和累计距离表示路线构造过程,在每个决策步选择下一个城市。
- 以欧氏移动距离的负值作为逐步奖励,对重复访问施加惩罚,将优化目标转化为学习信号。
- 从回放样本中通过时序差分损失学习 Q 值,周期更新目标网络,并结合动态规划和 LKH 工具检查路线。
成果与发现
- 完成从问题建模、环境实现、DQN 训练到路线检查的学习式求解流程。
- 将组合优化与强化学习组件结合,为分析状态和奖励设计如何影响序贯选择提供了可操作的实验场景。