摘要由 AI 生成
2026 年 9 月 7 日,arXiv 发布 RoboSPA,这是一个旨在诊断视觉 - 语言 - 动作(VLA)模型具身推理能力的大规模机器人操作数据集与基准测试。该基准涵盖 10 个任务类别和 56 个基础任务,每个任务包含五个难度等级,共生成 280 个变体,涉及 52.7 万条轨迹及多种场景。RoboSPA 聚焦于精细空间推理与长程过程规划两个核心维度,并引入超越二元成功率的诊断指标以评估模型表现。实验结果显示,现有 VLA 模型在复杂空间关系理解、精确低层执行以及高内存消耗规划方面仍面临显著挑战。
关键实体KEY ENTITIES
RoboSPAVLA models
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
整合时间线UNIFIED TIMELINE
-
2026-09-04
RoboSPA: Can VLA Models Go Beyond Simpl…
研究团队推出 RoboSPA 数据集与基准,旨在评估视觉 - 语言 - 动作(VLA)模型在复杂空间与程序任务中的推理能力。该基准涵盖 10 类 56 项基础任务,每类设置五个难度等级,共生成 280 个变体,包含 52.7 万条轨迹数据…
-
2026-09-07
RoboSPA: Can VLA Models Go Beyond Simpl…
arXiv:2609.05324v1 发布 RoboSPA,这是一个用于诊断视觉 - 语言 - 动作(VLA)模型具身推理能力的大规模机器人操作数据集与基准测试。该基准涵盖 10 个任务类别和 56 个基础任务,每个任务包含五个难度等级,…
信号强度SIGNALS
全部报道(2)SOURCES
↗
研究团队推出 RoboSPA 数据集与基准,旨在评估视觉 - 语言 - 动作(VLA)模型在复杂空间与程序任务中的推理能力。该基准涵盖 10 类 56 项基础任务,每类设置五个难度等级,共生成 280 个变体,包含 52.7 万条轨迹数据。RoboSPA 聚焦细粒度空间推理与长程程规划两个核心维度,引入超越二元成功率的诊断指标。实验表明,现有 VLA 模型在复杂空间关系、精确底层执行及高内存消耗规划方面仍面临挑战。该成果确立了 RoboSPA 作为开发更可靠通用具身智能体的诊断基准地位,相关数据与代码已开源。
↗
arXiv:2609.05324v1 发布 RoboSPA,这是一个用于诊断视觉 - 语言 - 动作(VLA)模型具身推理能力的大规模机器人操作数据集与基准测试。该基准涵盖 10 个任务类别和 56 个基础任务,每个任务包含五个难度等级,共生成 280 个变体,涉及 52.7 万条轨迹及多种场景。RoboSPA 聚焦于精细空间推理与长程过程规划两个核心维度,并引入超越二元成功率的诊断指标。实验显示,现有 VLA 模型在复杂空间关系、精确低层执行及高内存消耗规划方面仍面临挑战。