返回新闻列表
2026-09-05 14:00
AI123

星尘智能推出SmoothRL框架 破解机器人异步在线强化学习难题

星尘智能基座模型团队近日发布了一款可异步执行的在线强化学习框架SmoothRL,旨在解决大模型异步推理成为机器人真实部署常态后,在线强化学习应如何选择学习对象的问题。

传统在线强化学习模型通常以动作分块形式生成连续动作,但模型推理与机器人执行之间存在时间差。机器人在执行上一段动作时,模型已在后台生成下一段动作,部分生成动作可能在实际执行前就被后续指令替换。SmoothRL将动作分块划分为已提交、执行和丢弃三个区域,仅针对机器人实际执行的动作进行强化学习,使训练过程与真实部署保持一致。

在星尘智能S1机器人上的实测数据显示,经过在线强化学习,动态投掷、给笔戴帽、快递开箱三项任务的成功率分别由39%、8%、30%提升至94%、83%、90%。其中,投掷任务重点验证了在线强化学习在连续高速、不能停顿的动态操作中的应用能力。

研究表明,在线强化学习不仅能够提升机器人在高动态和高精度任务中的成功率,还能够修正基础策略在真实环境中的系统性偏差,使机器人动作更加平滑。星尘智能表示,SmoothRL探索的是机器人基础模型进入真实世界后的持续优化路径,即利用真实执行反馈进一步修正动作策略,推动机器人从“会做”向“做得更准、更稳”演进。下一步,团队将继续探索更大范围的策略更新、更广泛的任务分布,以及异步执行与生成式策略端到端优化之间的结合。

来源
  1. 2026-09-04 19:33 | 中国科技网:星尘智能发布在线强化学习框架SmoothRL
    阅读原文

    2026-09-04 19:33:13 来源: 科技日报 点击数: 0 ...

其他新闻

查看全部