用强化学习控制交通信号
基于 SUMO 的深度强化学习仿真
2024.06—2024.11
将交通信号配时建模为马尔可夫决策过程,在仿真中研究基于 DQN 的控制策略。
项目角色
项目负责人
主要方法
强化学习 · DQN · SUMO

研究问题
交通信号配时是一个序贯决策问题:每一次相位选择都会改变下一次决策所面对的交通状态。本项目在道路仿真环境中探索强化学习用于自适应信号控制的方法。
我的贡献
- 负责项目,将交通信号控制建模为马尔可夫决策过程。
- 设计基于 DQN 的信号配时方法,并开展 SUMO 仿真实验。
- 开发基于 Vue 的交互界面,用于呈现交通控制流程与可视化结果。
技术路线
- 状态与动作设计:根据车道车辆数和容量计算归一化密度,以可用绿灯相位构造离散动作空间,将交通测量转化为控制器可学习的输入。
- 仿真接入:将环境封装、信号控制、Q 网络与经验回放分成独立模块;在相位执行时处理黄灯过渡和持续时间,使学习策略遵守仿真的信号切换约束。
- 奖励与诊断:当前实现根据动作是否服务于排队车辆最多的车道组构造奖励,并记录停车数量和相位历史,用于检查这一启发式目标如何影响控制行为。
成果与发现
- 建立了从交通状态提取、DQN 决策到信号执行和 CSV 分析的模块化流程。项目的工程重点是让学习循环在相位切换与时间约束下运行,并能追踪每次决策对应的交通反馈。
- 通过车道密度观测、队列反馈和相位记录,使控制过程可以被逐步检查,建立算法设计与仿真行为之间的对应关系。

