One MLLM, One Call: Efficient Zero-Shot Vision-and-Language Navigation via Spatial-Aware Waypoints
提出名为 O2C-Nav 的高效零样本视觉 - 语言导航框架,该框架在每次决策步骤中仅调用一次大模型。该方法采用无需训练的有结构航点生成器及新型抽象表示,将稀疏的、具有历史感知的候选航点直接投影为 RGB 图像上的视觉标记;大语言模型(MLLM)在每个步骤选择航点或生成回退目标边界框,低层快速行进法(FMM)规划器将其转换为可执行的无碰撞路径。在 R2R-CE 和 RxR-CE 基准测试中的广泛评估表明,O2C-Nav 优于当前最先进的零样本方法,展示了其在实时机器人部署方面的巨大潜力。相关代码已发布在 https://github.com/kkpsq/O2C-Nav-Code。