CAM: Question Answering on Entity-Centric Videos with Continuous Extraction and Adaptive Querying
CAM 提出一种基于实体中心视频的问答方法,通过连续提取和自适应查询解决长视频问答难题。该方法将视频片段中提取的实体与关系存入知识图谱,当子图达到预设规模时总结其高语义特征;同时支持知识图谱遍历、视频重看及音频聆听等多种检索方式,利用规划 - 执行 - 验证流水线根据问题意图动态组合检索策略。在三个基准测试中,CAM 性能优于最先进基线,准确率提升最高达 23 个百分点。代码已开源。