科技日报记者 崔爽
当大模型异步推理成为机器人真实部署的常态,online RL(在线强化学习)究竟应该从哪些动作中学习?瞄准这一问题,近日,星尘智能(Astribot)基座模型团队发布能异步执行的在线强化学习框架SmoothRL,旨在让在线强化学习跟上大模型的异步推理。
传统在线强化学习模型通常以action chunk(动作分块)形式生成连续动作,但模型推理与机器人执行存在时间差,机器人在执行上一段动作的同时,模型已在后台生成下一段动作,部分生成的动作可能在实际执行前就被后续指令替换。而SmoothRL将action chunk划分为已提交、执行和丢弃三个区域,仅针对机器人实际执行的动作进行强化学习,使训练过程与真实部署保持一致。
在星尘智能S1机器人上的实测数据显示,经过在线强化学习,动态投掷、给笔戴帽、快递开箱三项任务的成功率分别由39%、8%、30%提升至94%、83%、90%。其中,投掷任务重点验证了在线强化学习在连续高速、不能停顿的动态操作中的应用能力。
研究表明,在线强化学习不仅能够提升机器人在高动态和高精度任务中的成功率,还能够修正基础策略在真实环境中的系统性偏差,使机器人动作更加平滑。星尘智能表示,SmoothRL探索的是机器人基础模型进入真实世界后的持续优化路径,即利用真实执行反馈进一步修正动作策略,推动机器人从“会做”向“做得更准、更稳”演进。下一步,团队将继续探索更大范围的策略更新、更广泛的任务分布,以及异步执行与生成式策略端到端优化之间的结合。

网友评论