科技日报记者 杨雪
当VLA(视觉语言动作)模型理解语言、感知环境并直接生成机器人动作时,一个更基础的问题开始浮现:机器人如何理解一个持续变化的物理世界?物体从哪里移动而来、杯子此前遮住了什么、机械臂正在接近还是远离目标——真正决定下一步动作的信息,往往不只存在于当前一帧,而是存在于连续的时间之中。
近日,大晓机器人联合香港大学发布全新的连续物理智能研究成果StreamPI,直指VLA长期存在的“单帧智能”瓶颈,为其补上关键的“时间维度”。不同于传统VLA主要依据当前观测独立决策,StreamPI为模型建立持续的多模态时序上下文,使机器人能够记住过去、理解状态变化、判断任务进程,并利用跨帧信息增强精细空间感知与动作决策。它推动VLA从“识别当前状态”,进一步走向“理解一个正在发生的物理过程”。
更重要的是,StreamPI并未依赖额外参数堆叠换取时序能力,而是基于现有VLA骨干,通过指令持续锚定、历史信息流式缓存与随机时间间隔训练,实现从单帧决策到连续时序建模的轻量化扩展。实验显示,StreamPI在时序记忆、精细空间操作与长程连续任务中取得显著提升。StreamPI所探索的不只是“让VLA多看几帧”,而是让机器人开始同时理解空间、时间与状态的演化,为具身基础模型从面向单一时刻的瞬时动作智能,迈向真正面向动态世界的连续物理智能提供新的技术路径。
StreamPI真正探索的,并不只是“为VLA增加历史信息”,而是推动机器人从基于当前状态决策,走向基于连续过程决策:现实世界不再是一组彼此孤立的静态画面,而是一条可以被记忆、理解和持续更新的时间流。
目前,StreamPI在超长时间跨度训练和极端异步场景下仍有进一步提升空间。未来,团队将探索超过100帧的高效时序训练与自适应缓存裁剪,将机器人的时序理解进一步延伸至更长、更复杂的真实任务。

网友评论