摘要由 AI 生成
研究团队提出 VESTA,一种无需训练的长视频智能体系统。该系统通过意图路由器在探索阶段推断聚焦、召回或对比检索策略及证据账户配置,并采用路由条件获取 - 验证 - 巩固循环处理任务。VESTA 利用多模态证据操作将检索结果转化为观察值,并通过时间证据账本整合位置、来源、冲突及验证结果,形成自适应视图以指导后续行动。在 Video-MME-v2 测试中,其平均准确率较 VideoARM 提升 2.7 分;在 LongVideoBench 长子集和 LVBench 上分别提升 6.9 分和 1.5 分,并在 EgoSchema 上与 VideoARM 表现持平。
关键实体KEY ENTITIES
EgoSchemaLongVideoBenchVESTAVideo-MME-v2VideoARM
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- VESTA1
- Video-MME-v21
- VideoARM1
- LongVideoBench1
- EgoSchema1
全部报道(1)SOURCES
↗
提出 VESTA,一种无需训练的长视频智能体,通过意图路由器在探索前推断聚焦、召回或对比检索策略及证据账户配置。该智能体采用路由条件获取 - 验证 - 巩固循环,利用多模态证据操作将检索结果转化为观察值,并由时间证据账本整合为包含位置、来源、冲突及验证结果的自适应视图以指导后续行动。在 Video-MME-v2 上,VESTA 平均准确率较 VideoARM 提升 2.7 分;在 LongVideoBench 长子集和 LVBench 上分别提升 6.9 分和 1.5 分,并在 EgoSchema 上与 VideoARM 持平。