SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-Based Humanoid Control
提出名为 SCRIPT 的可扩展扩散策略,旨在通过多阶段训练框架实现语言驱动的基于物理的人形控制。其核心是联合动作 - 状态 - 文本扩散 Transformer(JAST-DiT),将动作、物理状态和文本表示为专用令牌流并通过联合注意力耦合。为稳定自回归控制,引入非线性历史条件机制以保留近期密集上下文并采样长期稀疏线索。除监督模仿预训练外,还提出结合混合奖励的强化学习后训练阶段(RLHR),通过向流采样过程注入可学习噪声,在闭环仿真中利用混合物理反馈和文本奖励提升运动质量和指令遵循能力。定量评估显示 SCRIPT 优于现有最先进方法,且在 MotionMillion 数据集上的扩展研究表明其性能随模型规模提升而保持一致增益。代码将公开供未来研究使用。