智迹闻AuraTracer
EN

EVENT DOSSIER

持久型机器人世界模型:通过强化学习实现多步骤部署的稳定化

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
0个提及
摘要由 AI 生成

针对传统物理引擎难以模拟复杂任务及长序列预测质量下降的问题,研究人员提出一种基于强化学习的机器人世界模型训练方案。该方法摒弃对真实历史数据的依赖,转而利用模型自身生成的自回归推演进行后训练。通过引入多候选未来生成与比较协议,并结合多视角视觉保真度奖励函数,该方案在 DROID 数据集上取得显著成果。实验数据显示,其性能优于最强基线:外部相机 LPIPS 降低 14%,手腕相机 SSIM 提升 9.1%,赢得 98% 的配对比较,并在盲测中获得 80% 的人类偏好率,达到新的状态最水平。

相关事件RELATED EVENTS

全部报道(1)SOURCES

A arXiv cs.CV en 2026-09-07 12:00

Persistent Robot World Models: Stabilizing Multi-Step Rollouts via Reinforcement Learning

研究人员提出一种基于强化学习的机器人世界模型训练方案,旨在解决传统物理引擎难以模拟复杂任务及长序列预测质量快速下降的问题。该方法通过引入强化学习后训练机制,使模型在自身生成的自回归推演上进行训练而非依赖真实历史;同时设计了多候选未来生成与比较协议、结合多视角的视觉保真度奖励函数。实验表明,该方案在 DROID 数据集上达到新的状态最水平,在所有指标上均优于最强基线(如外部相机 LPIPS 降低 14%、手腕相机 SSIM 提升 9.1%),赢得 98% 的配对比较,并在盲测中获得 80% 的人类偏好率。