AuraTracer智迹闻
中文

EVENT DOSSIER

O2C-Nav 框架实现高效零样本视觉 - 语言导航

2026-09-06 16:49 Models 🔥 42.2 heat score
1sources
1days unfolding
42.2heat score
1mentions
SummaryAI generated

研究人员提出名为 O2C-Nav 的高效零样本视觉 - 语言导航框架,旨在提升实时机器人部署能力。该框架在每次决策步骤中仅调用一次大模型,采用无需训练的有结构航点生成器及新型抽象表示,将稀疏的、具有历史感知的候选航点直接投影为 RGB 图像上的视觉标记。大语言模型(MLLM)负责在每个步骤选择航点或生成回退目标边界框,低层快速行进法(FMM)规划器则将其转换为可执行的无碰撞路径。在 R2R-CE 和 RxR-CE 基准测试中的广泛评估表明,O2C-Nav 优于当前最先进的零样本方法。相关代码已发布在 GitHub 仓库中。

Related eventsRELATED EVENTS
Key entitiesKEY ENTITIES
O2C-Nav

SignalsSIGNALS

Keyword heat
  • O2C-Nav1

All reports (1)SOURCES

A arXiv cs.CV en 2026-09-06 16:49

One MLLM, One Call: Efficient Zero-Shot Vision-and-Language Navigation via Spatial-Aware Waypoints

提出名为 O2C-Nav 的高效零样本视觉 - 语言导航框架,该框架在每次决策步骤中仅调用一次大模型。该方法采用无需训练的有结构航点生成器及新型抽象表示,将稀疏的、具有历史感知的候选航点直接投影为 RGB 图像上的视觉标记;大语言模型(MLLM)在每个步骤选择航点或生成回退目标边界框,低层快速行进法(FMM)规划器将其转换为可执行的无碰撞路径。在 R2R-CE 和 RxR-CE 基准测试中的广泛评估表明,O2C-Nav 优于当前最先进的零样本方法,展示了其在实时机器人部署方面的巨大潜力。相关代码已发布在 https://github.com/kkpsq/O2C-Nav-Code。