LookStep: Efficient Vision-Language Navigation with Linguistic Foresight and Event Driven Memory
LookStep 提出一种结合语言中心未来状态建模与事件驱动滚动记忆的统一端到端框架,旨在提升视觉 - 语言导航的资源效率。该方法利用语言标签为候选动作生成粗粒度导航进度和未来状态,并自主决定将观察写入有界滚动记忆。在 VLN-CE 任务中,LookStep 在同训练设置下优于现有方法,在 R2R-CE Val-Unseen 数据集上取得 49.7% 的成功率,同时具备更好的内存效率和更低的数据使用量。