摘要由 AI 生成
ICM-Bench 作为首个评估多模态代理在长视频中进行身份中心化推理的基准测试,包含 839 个合成片段、141 分钟时长及针对六名成年人的 1,217 个开放式问题。对比直接 caption-memory 基线、记忆增强代理和图检索系统后,Gemini 3.1 Pro 整体准确率达 74.0%,但在需要长期身份档案的问题上准确率降至 60.3%。结果显示,当前多模态系统虽能恢复许多事件级记忆,但在证据需围绕稳定人物积累时可靠性较低。
关键实体KEY ENTITIES
Gemini 3.1 ProICM-Bench
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- ICM-Bench1
- Gemini 3.1 Pro1
全部报道(1)SOURCES
↗
ICM-Bench 是首个专门用于评估多模态代理在长视频记忆中进行身份中心化推理的基准测试。该基准包含 839 个合成片段、141 分钟时长及关于六名成年人的 1,217 个开放式问题。对比直接 caption-memory 基线、记忆增强代理和图检索系统后,Gemini 3.1 Pro 整体准确率达 74.0%,但在需要长期身份档案的问题上降至 60.3%。结果显示,当前系统虽能恢复许多事件级记忆,但在证据需围绕稳定人物积累时可靠性较低。