ARGOS: Who, Where, and When in Agentic Multi-Camera Person Search
研究者提出 ARGOS,这是一个将多相机人员搜索从完整查询检索重构为基于部分线索交互推理的基准与智能体框架。该框架首次耦合证人对话与相机网络拓扑,要求智能体在信息不对称下规划、提问并排除干扰。ARGOS 包含 2,691 个任务,涵盖三个渐进式轨道:语义感知(Who)、空间推理(Where)和时间推理(When)。实验使用四种 LLM 骨干模型,提出 Turn-Weighted Success(TWS)作为主要指标以衡量正确性与效率。结果显示最佳智能体在 Track 2 和 Track 3 的 TWS 分别为 0.383 和 0.590,表明该基准远未解决;消融实验证实,移除特定领域工具会使 Top-1 准确率下降高达 49.6 个百分点,而移除策略性推理虽对 Top-1 影响甚微,却使 TWS 减半。