MindTopo 揭示了 VLMs 的空间推理能力
MindTopo 发布新基准,用于评估多模态大语言模型在拓扑推理(连通性、封闭性、顺序、分离及打结)方面的能力。研究发现当前模型在静态图像识别上表现较好,但在涉及序列动作的规划任务中难以维持对拓扑关系的理解,常因场景变化而丢失结构关系或提出违反物理约束的动作。该基准依据皮亚杰认知理论分类,将任务分为连续性、分离性、顺序性、封闭性及打结性五类,并在推理与规划两个认知层级进行测试。所有场景由受控模拟器生成以确保精确真值,旨在揭示 AI 在机器人及交互式环境中进行可靠决策的关键差距。