← 返回更多项目
文献研读综述草稿

计算机视觉中的深度强化学习调研

跨视觉任务的简要综述

比较强化学习在关键点检测、目标检测、跟踪与分割任务中的建模方式。

项目角色

调研作者

主要方法

关键点检测 · 目标跟踪 · 语义分割

调研报告收录的交互式三维分割研究图,来源:Liao 等,Iteratively-Refined Interactive 3D Medical Image Segmentation with Multi-Agent Reinforcement Learning。
调研报告收录的交互式三维分割研究图,来源:Liao 等,Iteratively-Refined Interactive 3D Medical Image Segmentation with Multi-Agent Reinforcement Learning。 查看原尺寸图示

研究问题

强化学习在视觉任务中承担不同角色:搜索关键点、细化检测框、控制摄像机,或选择分割提示。我围绕这些任务的决策过程组织调研,分析序贯推理在视觉感知中的具体作用。

我的贡献

  • 撰写跨任务调研,覆盖关键点检测、目标检测、目标跟踪与语义分割。
  • 比较状态表征、动作空间、奖励函数,以及感知骨干与决策策略之间的连接方式。
  • 围绕状态中的视觉上下文、几何奖励与语义信息、时序特征的作用形成分析。

技术路线

  • 从动作与反馈入手,分析多尺度关键点搜索和多智能体协作定位的建模方式。
  • 对照边界框细化、自适应分辨率和图像块选择,梳理检测任务中计算资源分配的策略。
  • 区分主动摄像机控制与被动跟踪,再分析交互式分割、掩码修正和自动提示选择中的决策机制。

成果与发现

  • 形成以“状态—动作—奖励”为统一分析框架的调研文稿,将分散的视觉应用连接为可比较的方法体系。
  • 归纳强化学习直接参与视觉决策,以及引导搜索、分配计算和修正模型输出等不同作用,为后续感知与强化学习交叉研究建立方法基础。

我的分析:策略究竟在学习什么?

我比较方法时,首先关注智能体能获得什么信息,而不只看用了哪种强化学习算法。关键点搜索中,如果状态和奖励主要由坐标或距离构成,视觉上下文通过什么途径进入策略?检测任务中的区域特征与动作历史,使这一连接更加明确。

我区分直接预测视觉结果的策略,与分配计算或修正已有模型的策略。自适应分辨率、区域选择和边界框调整,分别优化感知流程中的不同环节,不能仅因使用强化学习就视为同一种建模。

跟踪中的关键区别是动作会改变摄像机,还是只改变目标框估计,这决定了环境转移的含义。分割中的点击选择和掩码细化,则体现了前序预测如何成为下一步决策的状态信息。

保持联系

欢迎通过邮件交流研究想法、项目经历与潜在合作。