星尘智能加码机器人强化学习后训练布局

2026-09-02 12:35:38 来源: 科技日报 点击数:

科技日报记者 崔爽

过去两年,机器人基础模型主要在解决“会不会”的问题。但随着机器人逐步走向真实部署和商业化,问题正在转向“能不能稳定做好”。作为让机器人依据真实经验实现快速优化的重要技术路线,强化学习领域备受关注。

日前,AI全栈具身智能公司星尘智能宣布扩充其机器人强化学习团队,引入有十余年强化学习背景的孙鹏博士,推动相关技术能力提升和应用部署。资料显示,孙鹏毕业于清华大学,为前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责⼈。过去十余年,其研究与产业实践始终围绕强化学习与智能体展开,并逐步从机器人强化学习拓展至大规模强化学习系统与大模型后训练,形成兼具算法研究与系统工程的技术积累。

据了解,星尘智能已逐步形成覆盖基座模型和商用模型、前端共生智能体、强化学习后训练的完整闭环。孙鹏将参与星尘具身模型、机器人强化学习及后训练体系建设,探索大模型时代已经被验证的强化学习后训练方法如何进一步与真实机器人执行、数据闭环和长期部署结合。

责任编辑:李梦一
网友评论
最热评论
没有更多评论了

抱歉,您使用的浏览器版本过低或开启了浏览器兼容模式,这会影响您正常浏览本网页

您可以进行以下操作:

1.将浏览器切换回极速模式

2.点击下面图标升级或更换您的浏览器

3.暂不升级,继续浏览

继续浏览