摘要由 AI 生成
2026 年 9 月 7 日,arXiv 发布了名为 MultihopSpatial 的视觉语言模型(VLM)基准测试。该研究旨在解决现有 VLM 忽视多步组合推理与精确视觉定位的问题。主要贡献包括:构建涵盖一至三步复杂查询的综合多步组合空间推理基准;提出同步评估推理与视觉定位能力的 Acc@50IoU 指标;发布 MultihopSpatial-Train 专用大规模训练语料。广泛评估显示,组合空间推理仍是严峻挑战,但通过在语料上进行强化学习后训练,可提升模型的内在空间推理能力及下游具身操作性能。
关键实体KEY ENTITIES
MultihopSpatialVLAVision-Language Models
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- MultihopSpatial1
- Vision-Language Models1
- VLA1
全部报道(1)SOURCES
↗
arXiv:2603.18892v2 发布 MultihopSpatial,旨在解决现有视觉语言模型(VLM)基准测试忽视多步组合推理与精确视觉定位的问题。该研究提供三项贡献:一是构建涵盖 1 至 3 步复杂查询的综合性多步组合空间推理基准;二是提出 Acc@50IoU 指标,同步评估推理与视觉定位能力;三是发布 MultihopSpatial-Train 专用大规模训练语料。对 37 个最先进 VLM 的广泛评估揭示了组合空间推理仍是严峻挑战,并证明在语料上进行强化学习后训练可提升模型内在空间推理能力及下游具身操作性能。