智迹闻AuraTracer
EN

EVENT DOSSIER

研究提出 CamVLM 框架:通过动态视点控制实现监控视频主动视觉推理

2026-09-06 16:48 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
3个提及
摘要由 AI 生成

研究人员提出 CamVLM 框架,旨在利用大视觉语言模型结合动态视点控制技术,使其能够像人类一样主动获取监控视频中的关键证据。该研究构建了包含 14,459 个视频、涵盖 10 类异常事件的大规模数据集 CCTV-Anomaly,以及 CamTrack-53K 物体中心视点轨迹数据集。团队建立了基于强化学习的视点策略优化框架,将相机控制建模为序贯决策过程以学习长程观察策略。实验结果显示,CamVLM 在被动观察和动态视点设置下均达到了最先进性能,验证了主动相机推理的有效性。相关数据、模型及代码已开源。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
CCTV-AnomalyCamTrack-53KCamVLM

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
CCTV-Anomaly × CamTrack…1CCTV-Anomaly × CamVLM1CamTrack-53K × CamVLM1

信号强度SIGNALS

关键词热度
  • CamVLM1
  • CCTV-Anomaly1
  • CamTrack-53K1

全部报道(1)SOURCES

A arXiv cs.CV en 2026-09-06 16:48

Thinking with Cameras: Active Visual Reasoning via Dynamic Viewpoint Control for Surveillance Video Understanding

研究人员提出 CamVLM 框架,通过动态视点控制使大视觉语言模型主动获取监控视频证据。该团队构建了含 14,459 个视频、涵盖 10 类异常的大规模数据集 CCTV-Anomaly,并建立了 CamTrack-53K 物体中心视点轨迹数据集。研究提出基于强化学习的视点策略优化框架,将相机控制建模为序贯决策过程以学习长程观察策略。实验表明,CamVLM 在被动观察和动态视点设置下均达到最先进性能,验证了主动相机推理的有效性。相关数据、模型及代码已开源。