WRC 2026:眸深智能首席科学家陈涛发表主题演讲,分享具身智能4.0技术路线

2026-08-22 20:26:44 来源: 科技日报 点击数:

科技日报记者 李均

8月19日至23日,2026世界机器人大会在北京举行。大会期间,上海眸深智能科技有限公司(以下简称“眸深智能”)联合创始人、首席科学家陈涛教授发表主题演讲,围绕“具身智能4.0:端侧原生的机器人世界运动模型”,系统分享企业在机器人运动智能、三维空间感知、端侧部署与模型自进化等方向的最新探索。

“我们团队从2019年起就在针对机器人的智能大脑做相关工作。”陈涛回顾了眸深智能在具身智能领域的技术积累。

从2022年的MLD,到2023年的MotionGPT,再到MotionChain、MotionStream、MotionGPT3,以及后续的LL3DA、HL3DWM和STIWMM,眸深智能持续围绕机器人“运动”这一核心问题展开研究。从最初的动作生成,到长程动作交互、三维空间理解,再到时空一体的世界动作建模,团队逐步形成从“理解”到“生成”、从“规划”到“执行”的技术体系。

基于一系列积累,眸深智能进一步提出第四代模型——World Motion Model(世界运动模型)。陈涛介绍,与以语言预测为核心的传统大模型不同,World Motion Model希望利用Next Token Prediction能力,进一步预测机器人下一步的隐式状态与动作,将世界理解、运动规划与动作生成连接起来。

“我们希望做的是一个机器人原生大脑。”在陈涛看来,具身智能的关键是让模型真正理解机器人所处世界,并能把这种理解转化为可执行的运动。

围绕这一目标,陈涛介绍了眸深智能在数据与空间智能方面的探索。

数据层面,眸深智能没有完全依赖大规模真机数据,而是探索将互联网视频、关节动捕和真机数据结合起来,通过不同类型数据完成世界知识学习、动作学习和机器人本体对齐。

在空间智能方面,以LL3DA为代表的三维空间理解技术,以及EgoExoLLM、Ego-affordance Estimation等工作,分别从三维环境理解、第一视角与第三视角协同推理、机器人可交互区域理解等方向进行探索。

如果说模型能力解决的是“机器人能不能做”,那么端侧部署解决的则是“机器人能不能真正用起来”。

陈涛在演讲中重点介绍了眸深智能长期积累的模型轻量化与端侧推理能力。针对具身模型参数规模大、推理成本高的问题,团队持续开展模型压缩、算力适配和芯片编译层优化,相关成果包括PAGCP、MADTP、MADTP++等。PPT显示,相关技术最高可实现75%的参数压缩、62倍计算量降低,以及端侧20倍推理加速。

同时,团队也在探索机器人智能的持续进化。最新的T2VLA工作尝试利用模型自身的置信度,通过Test-time RL实现无需外部奖励的自举策略优化,并在多个机器人操作benchmark中验证跨架构、跨场景的性能提升。

陈涛表示,未来机器人智能不应只依赖训练阶段不断增加数据,也需具备在运行过程中持续优化的能力。

演讲最后,陈涛将话题落到机器人产业化。

在他看来,通用具身大脑最终需进入真实的机器人、真实的工厂和真实的生活场景。因此,眸深智能正通过不同机器人本体和应用场景持续验证模型的泛化能力,让智能真正进入机器人身体,进入真实世界。

(受访者供图)

责任编辑:王倩
网友评论
最热评论
没有更多评论了

抱歉,您使用的浏览器版本过低或开启了浏览器兼容模式,这会影响您正常浏览本网页

您可以进行以下操作:

1.将浏览器切换回极速模式

2.点击下面图标升级或更换您的浏览器

3.暂不升级,继续浏览

继续浏览