科技日报记者 付丽丽
9月1日,杭州联汇科技股份有限公司(OmAI联汇)正式发布视频深度推理模型VLX-VR。该模型在Google DeepMind与哥伦比亚大学联合推出的视频推理基准MINERVA上,以78.8%的视频问答准确率登顶榜首,超越谷歌Gemini 3.5、OpenAI GPT-4.1等国际旗舰模型。

由Google DeepMind与哥伦比亚大学联合推出的MINERVA,被喻为全球视频推理领域的“最严考卷”。该基准包含1000多道取材于真实长视频的推理题目,人类在该基准上的得分为92.5分,而此前全球公开模型的最高成绩为70.7分。VLX-VR在取得78.8%准确率的同时,推理逻辑一致性达96.2%,表明其推理过程具备可追溯性。
跨时长表现是VLX-VR的突出特征。测试数据显示,在5分钟以下、5至15分钟、15分钟以上三个时长区间,VLX-VR的准确率分别为76.70%、78.73%和80.92%,准确率随视频时长增加不降反升。作为参考,Gemini 2.5 Pro在15分钟以上视频中的准确率为57.97%,GPT-4.1为47.25%。
此次发布是OmAI联汇技术积累的延续。2025年2月,该公司在GitHub开源视觉推理模型VLM-R1,首次将DeepSeek-R1的强化学习推理框架引入视觉领域。从VLM-R1到VLX-VR,研究团队的方向从单帧视觉理解延伸至长时序视频的推理。
在产业层面,VLX-VR的发布正值中国机器人产业标准化进程加速阶段。8月24日,工业和信息化部公示《国家人形机器人产业标准体系建设指南(2026版)》征求意见稿;8月26日,工业和信息化部在国新办“十五五”发布会上将具身智能列为未来产业方向。视频推理能力作为物理AI感知世界的基础能力,其技术进展与产业需求的关联正在加深。
(受访单位供图)

网友评论