智迹闻AuraTracer
EN

EVENT DOSSIER

相同的轨迹,却有不同的回报(ROBORMBENCH):视觉语言奖励模型中表达的模糊性

2026-09-07 12:00 科学 跨 2 天 🔥 47.2 事件热度
2家信源
2天持续发酵
47.2事件热度
1个提及
摘要由 AI 生成

研究团队引入 ROBORMBENCH 基准测试(含 2,390 条真实机器人轨迹及 21,673 个改写样本),评估视觉语言模型在机器人学习中的奖励函数鲁棒性。测试发现,现有专有及开源视语模型常违反“同轨迹不同语义等价指令应获相同奖励”的不变性原则:仅通过词汇、句法或动作 - 目标改写即可显著改变预测进度分数,甚至导致同一行为被判定为失败或成功。该不稳定性随改写差异增大而加剧,且无法通过扩大模型规模或显式推理可靠缓解。相比之下,经轨迹接地监督训练的专用奖励模型表现出显著更高的稳定性。研究证实,反改写鲁棒性是确保基于视语模型的机器人奖励建模可靠性的核心要求。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
ROBORMBENCH

整合时间线UNIFIED TIMELINE

  1. 2026-09-04

    Same Trajectory, Contradictory Rewards …

    Vision-language 模型作为机器人学习奖励函数时,需满足同轨迹在不同语义等价指令下获得相同奖励的不变性,但现有模型常违反此属性。研究团队引入 ROBORMBENCH 基准测试,包含 2,390 条真实机器人轨迹、真值进度标签及…

  2. 2026-09-07

    Same Trajectory, Contradictory Rewards …

    Vision-language 模型作为机器人学习奖励函数时,需满足同轨迹在不同语义等价指令下获得相同奖励的特性。研究团队引入 ROBORMBENCH 基准测试,包含 2,390 个真实机器人轨迹、真值进度标签及 21,673 个经验证的…

信号强度SIGNALS

关键词热度
  • ROBORMBENCH2

全部报道(2)SOURCES

A arXiv cs.CL en 2026-09-05 01:47

Same Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models

Vision-language 模型作为机器人学习奖励函数时,需满足同轨迹在不同语义等价指令下获得相同奖励的不变性,但现有模型常违反此属性。研究团队引入 ROBORMBENCH 基准测试,包含 2,390 条真实机器人轨迹、真值进度标签及涵盖词汇、句法与动作目标重写的 21,673 个验证改写句。测试显示,仅改写指令即可显著改变预测进度分数,甚至使相同机器人行为在失败与成功间翻转;该不稳定性广泛存在于专有及开源视觉语言模型中,随改写差异增大而加剧,且无法通过规模或显式推理可靠缓解。经轨迹 grounding 监督训练的专用奖励模型则显著更稳定。结果表明,同义不变性是确保基于视觉语言模型的机器人奖励建模可靠性的核心要求。

A arXiv cs.CL en 2026-09-07 12:00

Same Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models

Vision-language 模型作为机器人学习奖励函数时,需满足同轨迹在不同语义等价指令下获得相同奖励的特性。研究团队引入 ROBORMBENCH 基准测试,包含 2,390 个真实机器人轨迹、真值进度标签及 21,673 个经验证的改写样本(涵盖词汇、句法及动作 - 目标重写),发现当前视觉语言模型常违反该属性:仅改写指令即可显著改变预测进度分数,甚至使相同机器人行为在失败与成功间翻转。跨专有及开源视觉语言模型的测试表明,这种由改写引发的不稳定性广泛且严重,随改写差异增大而加剧,且无法通过规模扩大或显式推理可靠缓解;而使用轨迹接地监督训练的专用奖励模型则显著更稳定。结果证明,反改写鲁棒性是确保基于视觉语言模型的机器人奖励建模可靠性的核心要求。