智迹闻AuraTracer
EN

EVENT DOSSIER

星尘发布在线强化学习框架SmoothRL,实现与大模型的异步推理

星尘智能正式发布 SmoothRL 框架并验证其在高动态投掷任务中的异步在线强化学习能力

2026-09-04 17:19 大模型 🔥 47.2 事件热度
2家信源
1天持续发酵
47.2事件热度
3个提及
摘要由 AI 生成

2026 年 9 月 4 日,星尘智能(Astribot)基座模型团队正式发布名为 SmoothRL 的在线强化学习框架。该框架旨在解决大模型异步推理成为常态后,如何从动作中持续修正能力的问题,使机器人更精准、稳定且可靠。SmoothRL 支持强化学习过程在模型推理过程中持续进行,无需等待推理完成。其首次将异步在线强化学习应用于真实高动态投掷任务,验证了该技术不仅能用于高精度修正,还能适配连续加速与精确释放等无法停顿的动态操作。星尘智能正通过其“AI 模型 - 具身 OS-绳驱本体”全栈系统推动 Physical AI 应用与规模化部署,下一步计划探索更大范围的策略更新、更广泛的任务分布,以及异步执行与生成式策略端到端优化的结合。

相关事件RELATED EVENTS
事件速览QUICK FACTS
2026-09-04发布日期
SmoothRL框架名称
关键实体KEY ENTITIES
AstribotSmoothRL星尘智能

事件框架EVENT FRAME

产品发布

国内 · 主流媒体跨 1 天

当前状态

星尘智能正式发布 SmoothRL 框架并验证其在高动态投掷任务中的异步在线强化学习能力

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
SmoothRL × 星尘智能2Astribot × SmoothRL1Astribot × 星尘智能1

整合时间线UNIFIED TIMELINE

  1. 2026-09-04

    星尘发布 SmoothRL 框架

    星尘智能基座模型团队正式发布 SmoothRL,支持异步执行,无需等待推理完成即可持续进行强化学习。

    2 条报道

信号强度SIGNALS

关键词热度
  • 星尘智能2
  • SmoothRL2
  • Astribot1

全部报道(2)SOURCES

新浪科技 zh 2026-09-04 08:00

星尘发布在线强化学习框架SmoothRL,实现与大模型的异步推理

星尘智能基座模型团队近日发布在线强化学习框架SmoothRL,该框架支持异步执行,解决了大模型异步推理成为真实部署常态后,如何从动作中持续学习的问题。SmoothRL首次将异步online RL应用于真实高动态投掷任务,验证了在线学习不仅能用于高精度修正,也能适配连续加速、精确释放、无法停顿的动态操作。 该框架指向一个关键问题:预训练让机器人学会怎么做,而真实世界中的后训练则需根据执行结果持续修正自身能力,使机器人更准、更稳、更可靠。 在模型全面发展过程中,星尘“AI模型-具身OS-绳驱本体”全栈系统持续迭代,推动Physical AI应用与规模化部署。下一步,团队计划探索更大范围的策略更新、更广泛的任务分布,以及异步执行与生成式策略端到端优化之间的结合。