摘要由 AI 生成
针对具身智能体在跨小时至天级长时观察中缺乏可查询动态物体状态转换记忆的问题,研究人员提出 Linguistic Trajectory Encoding(LTE)方案。该方案通过结合自然语言描述、稀疏空间锚点及视觉锚点的混合表示,自适应压缩动态物体运动历史。为此,研究构建了 Spatial Memory Benchmark(SMB)以评估长时延能力,涵盖语义轨迹检索与长时程物体检索任务。在 SMB 测试中,基于 LTE 的系统实现了 45.3% 的语义轨迹检索成功率和 48.7% 的长时程物体检索率,分别优于结构化记忆和视觉语言模型基线(最佳先验分别为 31.9% 和 34.4%)。
关键实体KEY ENTITIES
Linguistic Trajectory EncodingSpatial Memory Benchmark
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- Linguistic Trajectory Encoding1
- Spatial Memory Benchmark1
全部报道(1)SOURCES
↗
Embodied agents 在跨小时至天级的长时观察中,需具备可自然语言查询的动态物体状态转换记忆。现有系统均存在局限,无法提供此类按对象组织的可查询时间线。本研究提出 Linguistic Trajectory Encoding (LTE),通过结合自然语言描述、稀疏空间锚点及视觉锚点的混合表示压缩动态物体运动历史,并依据运动复杂度自适应调整压缩策略。研究构建了 Spatial Memory Benchmark (SMB) 以评估长时延能力,涵盖语义轨迹检索与长时程物体检索任务。在 SMB 上,基于 LTE 的系统实现 $45.3\%$ 的语义轨迹检索成功率及 $48.7\%$ 的长时程物体检索率,分别优于结构化记忆和视觉语言模型基线(最佳先验为 $31.9\%$ 和 $34.4\%$)。LTE 在 $…