#AI
星尘发布 SmoothRL 异步在线强化学习框架
星尘智能(Astribot)基座模型团队发布在线强化学习框架 **SmoothRL**,专门解决机器人异步推理(existing asynchronous execution)下的 RL 训练问题。真实部署中机器人不等模型算完就继续执行动作,导致模型「计划过」的动作和机器人「真正做过」的动作不再一一对应。
团队在绳驱本体星尘 S1 上用三个真机任务验证:动态投掷成功率从 39% 提到 94%,给笔戴帽从 8% 提到 83%,快递开箱从 30% 提到 90%。三项均为异步推理下高动态或高精度操作,证明在线 RL 不只能做高精度修正,也能适配不能停顿的连续动态任务。项目负责人王佳楠,技术报告已发布于官网。
💡 为什么值得看在线 RL 首适配异步真机,任务成功率跃升,具身后训练值得关注。
查证
来源档案
量子位
中文 AI 科技媒体,本文为星尘智能官方提供材料、量子位获授权转载
内容来自厂商官方供稿,数据与结构描述可信,但成功率为厂商自报、未经第三方复现;框架细节见官方技术报告
延伸阅读
正文详细解释了 committed/execution/discarded 三区划分与梯度只过 execution region 的动机,是理解该方法内核的部分
开箱成功率从 30% 先降到 20% 再回升到 90%,揭示真实在线探索并非一路向上,对评估 RL 训练有启发