摘要由 AI 生成
SimpleMemVLA 团队发布了一种无需专用记忆模块的视觉 - 语言 - 动作模型。该模型将采样历史以时间戳视频格式完整传递给骨干网络,仅利用生成子任务的隐藏状态作为通往标准流匹配动作头的唯一通道。由于连续决策共享大部分历史,在执行动作时预填充共享前缀可将延迟保持在单帧 VLA 水平。在固定骨干和训练设置的情况下,SimpleMemVLA 大幅优于检索、压缩和循环状态机制,因果干预证实策略确实读取了其历史。该方案在四个记忆基准测试中刷新了最先进水平。
关键实体KEY ENTITIES
Cheng YinJunpeng YangSikyuen TamSimpleMemVLAWang Xu
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- SimpleMemVLA1
- Cheng Yin1
- Wang Xu1
- Junpeng Yang1
- Sikyuen Tam1
全部报道(1)SOURCES
↗
SimpleMemVLA 团队提出一种无需专用记忆模块的视觉 - 语言 - 动作模型,在四个记忆基准测试中刷新了最先进水平。该模型将采样历史以时间戳视频格式完整传递给骨干网络,仅利用生成子任务的隐藏状态作为通往标准流匹配动作头的唯一通道。由于连续决策共享大部分历史,在执行动作时预填充共享前缀可将延迟保持在单帧 VLA 水平。在固定骨干和训练设置的情况下,SimpleMemVLA 大幅优于检索、压缩和循环状态机制,因果干预证实策略确实读取了其历史。