Towards Neuro-Symbolic Procedural Reasoning for Long-Horizon Vision-Language-Action Manipulation
针对长程视觉 - 语言 - 动作操作任务中模型脆弱性问题,研究提出结合学习到的 VLA 控制与显式任务图及多模态过程记忆的神经符号框架。该框架利用任务图编码动作依赖、有效过渡和分支条件,通过记忆维护活跃步骤、已完成动作、文本上下文及相关视觉证据,并辅以人类演示中的注视或显著性线索进行空间和时间引导。研究在机器人视角遥操作视频中直接标注伪注视以隔离其对策略学习的影响,并将此指导用于 VLA 微调与推理。实验涵盖工作区清理和手术器械处理两个长程操作领域,评估了正确对象与目的地选择、子任务完成度、任务进度、步骤顺序一致性、完整任务成功率及过程或执行错误。该工作确立了结构化符号推理与演示衍生视觉引导作为可靠长程 VLA 操作的互补机制。