从人类视频到机器人技能:大晓发布全球首个可仿真人—场景交互重建框架HSImul3R

2026-09-08 16:37:59 来源: 科技日报 点击数:

科技日报记者 杨雪

一段人坐上椅子的视频,对人类而言,我们不仅能看见“人坐了下来”,还天然理解椅子承受人体重量,人与椅面形成接触并最终稳定。这些重力、接触与作用关系共同构成真实世界中的物理交互。但对今天的三维重建系统而言,“看见动作”与“重建真实交互”仍是两回事。一个视觉上准确坐在椅子上的人体,进入物理仿真后,椅子可能因结构缺失倒下,人体也可能与椅面严重穿模。视觉上成立,并不意味着物理交互上成立。

近日,大晓机器人联合南洋理工大学S-Lab、上海人工智能实验室发布全新人—场景交互重建研究HSImul3R,直指三维视觉长期存在的“感知—仿真鸿沟”,推动三维重建从“视觉正确”走向“物理可执行”。该成果已被全球计算机视觉顶级会议ECCV 2026正式接收。不同于传统方法主要关注人和场景是否重建得像、是否对齐,HSImul3R将重力稳定性、真实接触与交互稳定性纳入核心评价标准。团队将其定义为首个面向非标定稀疏视角输入、实现稳定可仿真(Simulation-Ready)人—场景交互重建的框架,并进一步支持单目视频输入。

与此同时,团队构建了面向人—场景交互的HSIBench,直接检验重建结果能否在物理仿真中稳定交互。HSImul3R在Easy、Medium、Hard三档任务中的交互稳定率分别达到53.68%、30.56%和13.92%,显著高于HSfM的10.52%、4.50%和2.66%,并将人—场景三维穿模率从69.51%降至 22.90%。

为实现这一目标,HSImul3R提出物理闭环(Physics-in-the-Loop)双向优化框架,让物理仿真器从最终检验工具变成重建过程中的主动监督者。一方面,通过面向场景的强化学习(Scene-targeted Reinforcement Learning)优化人体运动,使其既物理可行,又能与当前场景稳定交互;另一方面,通过直接仿真奖励优化(Direct Simulation Reward Optimization,DSRO),利用交互后的仿真反馈反向优化三维场景。最终,团队将优化后的人体动作迁移至Unitree G1 人形机器人,贯通日常图像/视频→三维人—场景交互重建→物理仿真优化→人形机器人动作迁移→真实机器人执行的完整链路,让人类视频中的交互经验从视觉信息进一步转化为可仿真、可学习、可执行的机器人技能资产。

这条路线仍处于早期阶段,复杂交互、多物体场景和动态环境依然存在大量挑战。但 HSImul3R已经给出一个重要方向:机器人从人类视频中学习的,不应只是“人看起来怎么动”,更应该是这个动作为什么能够在真实物理世界中成立。

责任编辑:李梦一
网友评论
最热评论
没有更多评论了

抱歉,您使用的浏览器版本过低或开启了浏览器兼容模式,这会影响您正常浏览本网页

您可以进行以下操作:

1.将浏览器切换回极速模式

2.点击下面图标升级或更换您的浏览器

3.暂不升级,继续浏览

继续浏览