智迹闻AuraTracer
EN

EVENT DOSSIER

SCRIPT:基于多阶段训练的可扩展扩散策略,用于语言驱动的物理基础人形机器人控制

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

研究人员提出名为 SCRIPT 的可扩展扩散策略,旨在通过多阶段训练框架实现语言驱动的基于物理的人形机器人控制。该方案核心在于联合动作 - 状态 - 文本扩散 Transformer(JAST-DiT),将动作、物理状态和文本表示为专用令牌流并通过联合注意力机制进行耦合。为稳定自回归控制过程,系统引入了非线性历史条件机制,用于保留近期密集上下文并采样长期稀疏线索。在训练流程上,除监督模仿预训练外,还设计了结合混合奖励的强化学习后训练阶段(RLHR),通过向流采样过程注入可学习噪声,并在闭环仿真环境中利用混合物理反馈和文本奖励来提升运动质量与指令遵循能力。定量评估表明 SCRIPT 优于现有最先进方法,且在 MotionMillion 数据集上的扩展研究显示其性能随模型规模提升而保持一致增益。相关代码将公开供未…

相关事件RELATED EVENTS
关键实体KEY ENTITIES
SCRIPT

信号强度SIGNALS

关键词热度
  • SCRIPT1

全部报道(1)SOURCES

A arXiv cs.LG en 2026-09-07 12:00

SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-Based Humanoid Control

提出名为 SCRIPT 的可扩展扩散策略,旨在通过多阶段训练框架实现语言驱动的基于物理的人形控制。其核心是联合动作 - 状态 - 文本扩散 Transformer(JAST-DiT),将动作、物理状态和文本表示为专用令牌流并通过联合注意力耦合。为稳定自回归控制,引入非线性历史条件机制以保留近期密集上下文并采样长期稀疏线索。除监督模仿预训练外,还提出结合混合奖励的强化学习后训练阶段(RLHR),通过向流采样过程注入可学习噪声,在闭环仿真中利用混合物理反馈和文本奖励提升运动质量和指令遵循能力。定量评估显示 SCRIPT 优于现有最先进方法,且在 MotionMillion 数据集上的扩展研究表明其性能随模型规模提升而保持一致增益。代码将公开供未来研究使用。