智迹闻AuraTracer
EN

EVENT DOSSIER

改进Atari Pong中强大智能体背后的弱世界模型

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
5个提及
摘要由 AI 生成

研究团队复现了 Atari Pong 环境中的五个视觉世界模型代理(DreamerV3、DIAMOND、TWISTER、Simulus 和 STORM),发现其冻结的世界模型存在明显的视觉或动力学失效,具体表现为球消失、运动错误及无效的球 - 挡板交互。在原生零样本基于模型的强化学习中,仅利用冻结模型从头训练的新策略在真实环境中的表现显著低于原代理:DreamerV3 下降幅度为 -5.5 至 -20.9,DIAMOND 为 19.7 至 -9.6,TWISTER 为 17.7 至 -13.3,Simulus 为 20.8 至 -11.6,STORM 为 18.7 至 -21.0。受球相关滚动失败启发,研究者提出了概念引导空间正则化(CGSReg),这是一种针对任务关键概念区的改进方法。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
DIAMONDDreamerV3STORMSimulusTWISTER

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
DIAMOND × DreamerV31DIAMOND × STORM1DIAMOND × Simulus1DIAMOND × TWISTER1DreamerV3 × STORM1DreamerV3 × Simulus1

信号强度SIGNALS

关键词热度
  • DreamerV31
  • DIAMOND1
  • TWISTER1
  • Simulus1
  • STORM1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

Improving Weak World Models Behind Strong Agents in Atari Pong

研究团队复现了 Atari Pong 中的五个视觉世界模型代理(DreamerV3、DIAMOND、TWISTER、Simulus 和 STORM),发现其冻结的世界模型存在明显的视觉或动力学失效,包括球消失、运动错误及无效的球 - 挡板交互。在原生零样本基于模型的强化学习(MBRL)中,仅利用冻结模型从头训练的新策略在真实环境中表现显著低于原代理:DreamerV3 下降幅度为 -5.5 至 -20.9,DIAMOND 为 19.7 至 -9.6,TWISTER 为 17.7 至 -13.3,Simulus 为 20.8 至 -11.6,STORM 为 18.7 至 -21.0(-21 为最低 Pong 回报)。受球相关滚动失败启发,研究者提出了概念引导空间正则化(CGSReg),这是一种针对任务关键概念区…