SummaryAI generated
研究人员提出 CamVLM 框架,旨在利用大视觉语言模型结合动态视点控制技术,使其能够像人类一样主动获取监控视频中的关键证据。该研究构建了包含 14,459 个视频、涵盖 10 类异常事件的大规模数据集 CCTV-Anomaly,以及 CamTrack-53K 物体中心视点轨迹数据集。团队建立了基于强化学习的视点策略优化框架,将相机控制建模为序贯决策过程以学习长程观察策略。实验结果显示,CamVLM 在被动观察和动态视点设置下均达到了最先进性能,验证了主动相机推理的有效性。相关数据、模型及代码已开源。
Related eventsRELATED EVENTS
Key entitiesKEY ENTITIES
CCTV-AnomalyCamTrack-53KCamVLM
Coverage · reports per dayLANGUAGE SPLIT
Entity relations
SignalsSIGNALS
Keyword heat
- CamVLM1
- CCTV-Anomaly1
- CamTrack-53K1
All reports (1)SOURCES
↗
研究人员提出 CamVLM 框架,通过动态视点控制使大视觉语言模型主动获取监控视频证据。该团队构建了含 14,459 个视频、涵盖 10 类异常的大规模数据集 CCTV-Anomaly,并建立了 CamTrack-53K 物体中心视点轨迹数据集。研究提出基于强化学习的视点策略优化框架,将相机控制建模为序贯决策过程以学习长程观察策略。实验表明,CamVLM 在被动观察和动态视点设置下均达到最先进性能,验证了主动相机推理的有效性。相关数据、模型及代码已开源。