摘要由 AI 生成
2026 年 9 月 4 日,星尘智能(Astribot)基座模型团队正式发布名为 SmoothRL 的在线强化学习框架。该框架旨在解决大模型异步推理成为常态后,如何从动作中持续修正能力的问题,使机器人更精准、稳定且可靠。SmoothRL 支持强化学习过程在模型推理过程中持续进行,无需等待推理完成。其首次将异步在线强化学习应用于真实高动态投掷任务,验证了该技术不仅能用于高精度修正,还能适配连续加速与精确释放等无法停顿的动态操作。星尘智能正通过其“AI 模型 - 具身 OS-绳驱本体”全栈系统推动 Physical AI 应用与规模化部署,下一步计划探索更大范围的策略更新、更广泛的任务分布,以及异步执行与生成式策略端到端优化的结合。
关键实体KEY ENTITIES
AstribotSmoothRL星尘智能
事件框架EVENT FRAME
当前状态
星尘智能正式发布 SmoothRL 框架并验证其在高动态投掷任务中的异步在线强化学习能力
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
整合时间线UNIFIED TIMELINE
-
2026-09-04
星尘发布 SmoothRL 框架
星尘智能基座模型团队正式发布 SmoothRL,支持异步执行,无需等待推理完成即可持续进行强化学习。
2 条报道
信号强度SIGNALS
关键词热度
- 星尘智能2
- SmoothRL2
- Astribot1
全部报道(2)SOURCES
↗
新
新浪科技
zh
2026-09-04 08:00
星尘智能基座模型团队近日发布在线强化学习框架SmoothRL,该框架支持异步执行,解决了大模型异步推理成为真实部署常态后,如何从动作中持续学习的问题。SmoothRL首次将异步online RL应用于真实高动态投掷任务,验证了在线学习不仅能用于高精度修正,也能适配连续加速、精确释放、无法停顿的动态操作。
该框架指向一个关键问题:预训练让机器人学会怎么做,而真实世界中的后训练则需根据执行结果持续修正自身能力,使机器人更准、更稳、更可靠。
在模型全面发展过程中,星尘“AI模型-具身OS-绳驱本体”全栈系统持续迭代,推动Physical AI应用与规模化部署。下一步,团队计划探索更大范围的策略更新、更广泛的任务分布,以及异步执行与生成式策略端到端优化之间的结合。
↗
量
量子位
zh
2026-09-04 17:19
星尘智能(Astribot)基座模型团队发布能异步执行的在线强化学习框架 SmoothRL。该框架允许强化学习过程在模型推理过程中持续进行,而无需等待推理完成。