RL-VLA$^3$: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training
arXiv:2602.05765v3 发布 RL-VLA$^3$,这是一个专为视觉 - 语言 - 动作(VLA)模型训练设计的完全异步分布式强化学习框架。该框架通过动态批处理调度器和灵活的环境分片策略,实现了仿真、推理与训练组件之间的细粒度异步交互,以解决传统同步设计在物理模拟器高延迟场景下的不匹配问题。实验表明,RL-VLA$^3$ 相比同步基线吞吐量提升最高达 85.2%,且保持样本效率一致,并已在 8 至 256 张 GPU 上验证了可扩展性。据称,这是首个针对 VLA 训练系统级挑战定制的完全异步强化学习训练框架。