摘要由 AI 生成
研究团队复现了 Atari Pong 环境中的五个视觉世界模型代理(DreamerV3、DIAMOND、TWISTER、Simulus 和 STORM),发现其冻结的世界模型存在明显的视觉或动力学失效,具体表现为球消失、运动错误及无效的球 - 挡板交互。在原生零样本基于模型的强化学习中,仅利用冻结模型从头训练的新策略在真实环境中的表现显著低于原代理:DreamerV3 下降幅度为 -5.5 至 -20.9,DIAMOND 为 19.7 至 -9.6,TWISTER 为 17.7 至 -13.3,Simulus 为 20.8 至 -11.6,STORM 为 18.7 至 -21.0。受球相关滚动失败启发,研究者提出了概念引导空间正则化(CGSReg),这是一种针对任务关键概念区的改进方法。
关键实体KEY ENTITIES
DIAMONDDreamerV3STORMSimulusTWISTER
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- DreamerV31
- DIAMOND1
- TWISTER1
- Simulus1
- STORM1
全部报道(1)SOURCES
↗
研究团队复现了 Atari Pong 中的五个视觉世界模型代理(DreamerV3、DIAMOND、TWISTER、Simulus 和 STORM),发现其冻结的世界模型存在明显的视觉或动力学失效,包括球消失、运动错误及无效的球 - 挡板交互。在原生零样本基于模型的强化学习(MBRL)中,仅利用冻结模型从头训练的新策略在真实环境中表现显著低于原代理:DreamerV3 下降幅度为 -5.5 至 -20.9,DIAMOND 为 19.7 至 -9.6,TWISTER 为 17.7 至 -13.3,Simulus 为 20.8 至 -11.6,STORM 为 18.7 至 -21.0(-21 为最低 Pong 回报)。受球相关滚动失败启发,研究者提出了概念引导空间正则化(CGSReg),这是一种针对任务关键概念区…