国产视频深度推理模型VLX-VR发布

2026-09-04 22:47:26 来源: 科技日报 点击数:

科技日报记者 付丽丽

9月1日,杭州联汇科技股份有限公司(OmAI联汇)正式发布视频深度推理模型VLX-VR。该模型在Google DeepMind与哥伦比亚大学联合推出的视频推理基准MINERVA上,以78.8%的视频问答准确率登顶榜首,超越谷歌Gemini 3.5、OpenAI GPT-4.1等国际旗舰模型。

由Google DeepMind与哥伦比亚大学联合推出的MINERVA,被喻为全球视频推理领域的“最严考卷”。该基准包含1000多道取材于真实长视频的推理题目,人类在该基准上的得分为92.5分,而此前全球公开模型的最高成绩为70.7分。VLX-VR在取得78.8%准确率的同时,推理逻辑一致性达96.2%,表明其推理过程具备可追溯性。

跨时长表现是VLX-VR的突出特征。测试数据显示,在5分钟以下、5至15分钟、15分钟以上三个时长区间,VLX-VR的准确率分别为76.70%、78.73%和80.92%,准确率随视频时长增加不降反升。作为参考,Gemini 2.5 Pro在15分钟以上视频中的准确率为57.97%,GPT-4.1为47.25%。

此次发布是OmAI联汇技术积累的延续。2025年2月,该公司在GitHub开源视觉推理模型VLM-R1,首次将DeepSeek-R1的强化学习推理框架引入视觉领域。从VLM-R1到VLX-VR,研究团队的方向从单帧视觉理解延伸至长时序视频的推理。

在产业层面,VLX-VR的发布正值中国机器人产业标准化进程加速阶段。8月24日,工业和信息化部公示《国家人形机器人产业标准体系建设指南(2026版)》征求意见稿;8月26日,工业和信息化部在国新办“十五五”发布会上将具身智能列为未来产业方向。视频推理能力作为物理AI感知世界的基础能力,其技术进展与产业需求的关联正在加深。

(受访单位供图)

责任编辑:冷媚
网友评论
最热评论
没有更多评论了

抱歉,您使用的浏览器版本过低或开启了浏览器兼容模式,这会影响您正常浏览本网页

您可以进行以下操作:

1.将浏览器切换回极速模式

2.点击下面图标升级或更换您的浏览器

3.暂不升级,继续浏览

继续浏览