AuraTracer智迹闻
中文

EVENT DOSSIER

研究提出 CamVLM 框架:通过动态视点控制实现监控视频主动视觉推理

2026-09-06 16:48 Models 🔥 42.2 heat score
1sources
1days unfolding
42.2heat score
3mentions
SummaryAI generated

研究人员提出 CamVLM 框架,旨在利用大视觉语言模型结合动态视点控制技术,使其能够像人类一样主动获取监控视频中的关键证据。该研究构建了包含 14,459 个视频、涵盖 10 类异常事件的大规模数据集 CCTV-Anomaly,以及 CamTrack-53K 物体中心视点轨迹数据集。团队建立了基于强化学习的视点策略优化框架,将相机控制建模为序贯决策过程以学习长程观察策略。实验结果显示,CamVLM 在被动观察和动态视点设置下均达到了最先进性能,验证了主动相机推理的有效性。相关数据、模型及代码已开源。

Related eventsRELATED EVENTS
Key entitiesKEY ENTITIES
CCTV-AnomalyCamTrack-53KCamVLM

Coverage · reports per dayLANGUAGE SPLIT

Entity relations
CCTV-Anomaly × CamTrack…1CCTV-Anomaly × CamVLM1CamTrack-53K × CamVLM1

SignalsSIGNALS

Keyword heat
  • CamVLM1
  • CCTV-Anomaly1
  • CamTrack-53K1

All reports (1)SOURCES

A arXiv cs.CV en 2026-09-06 16:48

Thinking with Cameras: Active Visual Reasoning via Dynamic Viewpoint Control for Surveillance Video Understanding

研究人员提出 CamVLM 框架,通过动态视点控制使大视觉语言模型主动获取监控视频证据。该团队构建了含 14,459 个视频、涵盖 10 类异常的大规模数据集 CCTV-Anomaly,并建立了 CamTrack-53K 物体中心视点轨迹数据集。研究提出基于强化学习的视点策略优化框架,将相机控制建模为序贯决策过程以学习长程观察策略。实验表明,CamVLM 在被动观察和动态视点设置下均达到最先进性能,验证了主动相机推理的有效性。相关数据、模型及代码已开源。