科技日报记者 李均
随着GPT-6 Astra爆火,数字世界的智能体范式正逐渐走向物理世界。但在物理世界中,不仅要“想明白”,还得“看得见、做得到、反应快、记得住”。
9月21日,清华大学、无问芯穹、正行创新联合开源具身智能体基础设施RPent。RPent不是让某一个模型变得无所不能,而是将具身智能拆解为不同层次的能力,将通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力,以及记忆、工具和机器人接口连接起来,形成感知—决策—执行—反馈纠错的完整闭环,使具身智能体能够持续适应环境变化,并将经过验证的经验沉淀为可复用的能力,在与物理环境的持续交互中不断学习和进化。
在LIBERO-PRO基准测试中达到92.6%的任务成功率,并将端到端任务完成速度优化7倍以上。

此次发布同步释出了一系列RPent真机demo,展示了多个有趣的开放式任务,且这些任务并不是为每一种场景单独训练一个专用策略。机器人真正发生的变化,是开始从“执行学过的动作”,走向“理解任务、调用能力,并根据环境变化调整行动”。

当任务变化为“将干净餐具放入纸箱”时,在RPent中,智能体会先观察当前环境,再根据新的目标选择放置位置。执行过程中,如果视觉定位出现偏差,它还会检查结果、排除错误目标,并重新定位手中的盘子。

当机器人需要读取瓶身和袋子上的品牌标签,将不同饮料放入对应的袋子时,它抓瓶后先小幅试抬确认夹稳;原路径不可行时,会调整腕部姿态继续。当勺子被碗遮挡时,它也不会直接抓取,而是先移开碗使其可见可达。
这里展示的不再是一条预先写死的动作序列,而是完整的“观察—判断—执行—纠错”闭环。

最后两个任务中,机器人可以将原本用于“拿起并放置容器”的技能重新组合,用于倾倒钢珠;又把抓取动作与双臂协同、持续接触组合起来,完成持盘、擦拭和收纳。探索成功后,RPent会把经过验证的任务逻辑沉淀为任务卡供下次执行复用,有效降低执行延时。
RPent所探索的,不是“机器人学会了几个动作”,而是“当机器人在真实世界,不断遇到新的任务、物体和障碍时,它能否像人一样将已有技能重新组织起来,完成训练分布之外的任务?”
当智能体走向真实世界,变化的不只是模型能力的边界,也包括支撑这种能力运行的基础设施形态。RPent所代表的,正是大模型真正走进物理世界之后,需要重新构建的下一层基础设施。
(受访单位供图)

网友评论