隐式触觉世界动作模型正式发布

2026-08-01 18:45:49 来源: 科技日报 点击数:

科技日报记者 马爱平

7月28日,通用具身基础模型企业北京智在无界科技有限公司(以下简称“智在无界”)正式发布隐式触觉世界动作模型Being-H0.8。

据悉,Being-H0.8首次将触觉模态引入大规模模型预训练,并将视觉、触觉、动作以及未来状态变化统一到同一隐空间。这使机器人不仅能够理解“看到了什么、做了什么、接触到了什么”,还能够进一步理解“世界因此发生了怎样的变化”,从而形成对物理交互过程更加完整的认知与预测能力。

据智在无界相关负责人介绍,Being-H0.8相较于前代Being-H0.7的核心突破,是首次将触觉模态系统性地引入隐式世界模型架构,它也是首个结合大规模人类视频与触觉信息开展预训练的具身基础模型。触觉的加入,使模型能够感知视觉难以直接观测的接触状态、受力变化与物体约束,从而完成一系列仅依赖视觉难以稳定解决的接触密集型任务。

“为了充分利用高频触觉反馈,Being-H0.8进一步提出慢快动作专家。在标准的完整动作块生成机制之上,模型引入了一条轻量级的快速更新流。系统首先在每个动作时域开始时计算一次‘世界—动作上下文’并进行缓存;随后,在时域内少数几个锚点处,注入最新观测到的本体状态与触觉反馈,动态生成或修正当前正在执行的动作片段。这一机制既保留了动作块预测的整体规划能力与计算效率,又能够根据接触过程中的实时反馈快速调整动作,为精密抓取、插拔、旋拧、装配等接触密集型操作提供更高的稳定性与响应速度。”上述负责人说。

据悉,历经Being-H0到Being-H0.8的持续迭代,智在无界已汇聚了超过50万小时的第一人称视频数据,并与数十家数据企业建立合作。此外,已完成从数据管线、模型预训练、后训练、评测到端侧部署的全栈基础设施建设。这套体系能够推动规模化数据持续沉淀、模型能力持续进化,并让机器人不断走向开放、复杂的真实物理世界。在此基础上,打造了高质量人类交互数据库UniHand 3.0。该数据库覆盖自然物体交互、长时程任务、丰富手部动作及多样化场景,为具身基础模型提供规模化、高质量的人类交互经验。

(受访者供图)

责任编辑:王倩
网友评论
最热评论
没有更多评论了

抱歉,您使用的浏览器版本过低或开启了浏览器兼容模式,这会影响您正常浏览本网页

您可以进行以下操作:

1.将浏览器切换回极速模式

2.点击下面图标升级或更换您的浏览器

3.暂不升级,继续浏览

继续浏览