Same Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models
Vision-language 模型作为机器人学习奖励函数时,需满足同轨迹在不同语义等价指令下获得相同奖励的不变性,但现有模型常违反此属性。研究团队引入 ROBORMBENCH 基准测试,包含 2,390 条真实机器人轨迹、真值进度标签及涵盖词汇、句法与动作目标重写的 21,673 个验证改写句。测试显示,仅改写指令即可显著改变预测进度分数,甚至使相同机器人行为在失败与成功间翻转;该不稳定性广泛存在于专有及开源视觉语言模型中,随改写差异增大而加剧,且无法通过规模或显式推理可靠缓解。经轨迹 grounding 监督训练的专用奖励模型则显著更稳定。结果表明,同义不变性是确保基于视觉语言模型的机器人奖励建模可靠性的核心要求。