智迹闻AuraTracer
EN

EVENT DOSSIER

从意图到证据:面向政策的多策略检索方法在长视频智能体中的应用

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
5个提及
摘要由 AI 生成

研究团队提出 VESTA,一种无需训练的长视频智能体系统。该系统通过意图路由器在探索阶段推断聚焦、召回或对比检索策略及证据账户配置,并采用路由条件获取 - 验证 - 巩固循环处理任务。VESTA 利用多模态证据操作将检索结果转化为观察值,并通过时间证据账本整合位置、来源、冲突及验证结果,形成自适应视图以指导后续行动。在 Video-MME-v2 测试中,其平均准确率较 VideoARM 提升 2.7 分;在 LongVideoBench 长子集和 LVBench 上分别提升 6.9 分和 1.5 分,并在 EgoSchema 上与 VideoARM 表现持平。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
EgoSchemaLongVideoBenchVESTAVideo-MME-v2VideoARM

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
EgoSchema × LongVideoBe…1EgoSchema × VESTA1EgoSchema × Video-MME-v21EgoSchema × VideoARM1LongVideoBench × VESTA1LongVideoBench × Video-…1

信号强度SIGNALS

关键词热度
  • VESTA1
  • Video-MME-v21
  • VideoARM1
  • LongVideoBench1
  • EgoSchema1

全部报道(1)SOURCES

A arXiv cs.CV en 2026-09-07 12:00

From Intent to Evidence: Policy-Steered Multi-Strategy Retrieval for Long-Video Agents

提出 VESTA,一种无需训练的长视频智能体,通过意图路由器在探索前推断聚焦、召回或对比检索策略及证据账户配置。该智能体采用路由条件获取 - 验证 - 巩固循环,利用多模态证据操作将检索结果转化为观察值,并由时间证据账本整合为包含位置、来源、冲突及验证结果的自适应视图以指导后续行动。在 Video-MME-v2 上,VESTA 平均准确率较 VideoARM 提升 2.7 分;在 LongVideoBench 长子集和 LVBench 上分别提升 6.9 分和 1.5 分,并在 EgoSchema 上与 VideoARM 持平。