星尘智能基座模型团队发布能异步执行的在线强化学习框架SmoothRL,将action chunk划分为已提交、执行和丢弃三个区域,仅针对机器人实际执行的动作进行强化学习。在S1机器人上实测,动态投掷、给笔戴帽、快递开箱三项任务成功率分别由39%、8%、30%提升至94%、83%、90%。