科技日报记者 崔爽
过去两年,机器人基础模型主要在解决“会不会”的问题。但随着机器人逐步走向真实部署和商业化,问题正在转向“能不能稳定做好”。作为让机器人依据真实经验实现快速优化的重要技术路线,强化学习领域备受关注。
日前,AI全栈具身智能公司星尘智能宣布扩充其机器人强化学习团队,引入有十余年强化学习背景的孙鹏博士,推动相关技术能力提升和应用部署。资料显示,孙鹏毕业于清华大学,为前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责⼈。过去十余年,其研究与产业实践始终围绕强化学习与智能体展开,并逐步从机器人强化学习拓展至大规模强化学习系统与大模型后训练,形成兼具算法研究与系统工程的技术积累。
据了解,星尘智能已逐步形成覆盖基座模型和商用模型、前端共生智能体、强化学习后训练的完整闭环。孙鹏将参与星尘具身模型、机器人强化学习及后训练体系建设,探索大模型时代已经被验证的强化学习后训练方法如何进一步与真实机器人执行、数据闭环和长期部署结合。

网友评论