计算机视觉中的深度强化学习调研
跨视觉任务的简要综述
比较强化学习在关键点检测、目标检测、跟踪与分割任务中的建模方式。
项目角色
调研作者
主要方法
关键点检测 · 目标跟踪 · 语义分割

研究问题
强化学习在视觉任务中承担不同角色:搜索关键点、细化检测框、控制摄像机,或选择分割提示。我围绕这些任务的决策过程组织调研,分析序贯推理在视觉感知中的具体作用。
我的贡献
- 撰写跨任务调研,覆盖关键点检测、目标检测、目标跟踪与语义分割。
- 比较状态表征、动作空间、奖励函数,以及感知骨干与决策策略之间的连接方式。
- 围绕状态中的视觉上下文、几何奖励与语义信息、时序特征的作用形成分析。
技术路线
- 从动作与反馈入手,分析多尺度关键点搜索和多智能体协作定位的建模方式。
- 对照边界框细化、自适应分辨率和图像块选择,梳理检测任务中计算资源分配的策略。
- 区分主动摄像机控制与被动跟踪,再分析交互式分割、掩码修正和自动提示选择中的决策机制。
成果与发现
- 形成以“状态—动作—奖励”为统一分析框架的调研文稿,将分散的视觉应用连接为可比较的方法体系。
- 归纳强化学习直接参与视觉决策,以及引导搜索、分配计算和修正模型输出等不同作用,为后续感知与强化学习交叉研究建立方法基础。
我的分析:策略究竟在学习什么?
我比较方法时,首先关注智能体能获得什么信息,而不只看用了哪种强化学习算法。关键点搜索中,如果状态和奖励主要由坐标或距离构成,视觉上下文通过什么途径进入策略?检测任务中的区域特征与动作历史,使这一连接更加明确。
我区分直接预测视觉结果的策略,与分配计算或修正已有模型的策略。自适应分辨率、区域选择和边界框调整,分别优化感知流程中的不同环节,不能仅因使用强化学习就视为同一种建模。
跟踪中的关键区别是动作会改变摄像机,还是只改变目标框估计,这决定了环境转移的含义。分割中的点击选择和掩码细化,则体现了前序预测如何成为下一步决策的状态信息。