OmAI 联汇登顶 Google DeepMind 权威基准, 以 78.8% 准确率刷新全球纪录
首页 > 电商学院 > 汉潮快讯 > OmAI 联汇登顶 Google DeepMind 权威基准, 以 78.8% 准确率刷新全球纪录

OmAI 联汇登顶 Google DeepMind 权威基准, 以 78.8% 准确率刷新全球纪录

0人阅读|发布时间:2026-09-03
导读:9 月 1 日, 杭州联汇科技股份有限公司正式发布视频深度推理模型 VLX-VR。

来源:极客公园

9 月 1 日, 杭州联汇科技股份有限公司 (简称:OmAI 联汇) 正式发布视频深度推理模型 VLX-VR。该模型在 Google DeepMind 与哥伦比亚大学联合推出的视频推理基准 MINERVA 上, 以 78.8% 的视频问答准确率登顶榜首, 超越谷歌 Gemini 3.5、OpenAI GPT-4.1 等国际旗舰模型。VLX-VR 同步上线开放体验平台, 成为全球首个在"既考答案、又考过程"的视频推理最严基准上「夺冠」的中国模型。

由 Google DeepMind 与哥伦比亚大学联合推出的 MINERVA, 被喻为全球视频推理领域的"最严考卷"。该基准包含 1000 多道取材于真实长视频的推理题目, 人类在该基准上的得分为 92.5 分, 而此前全球公开模型的最高成绩为 70.7 分。

不止于「答对」, 更敢于「晒过程」

VLX-VR 取得 78.8% 准确率的同时, 推理逻辑一致性 (本次评测数据) 达 96.2%——即模型的推理过程与人类标准推理轨迹的吻合度, 表明其不仅答案准确率较高, 得出答案的过程也具备可追溯性。

跨时长表现是 VLX-VR 较为突出的一项特征。测试数据显示, 在 5 分钟以下、5 至 15 分钟、15 分钟以上三个时长区间,VLX-VR 的准确率分别为 76.70%、78.73% 和 80.92%, 随视频时长增加不降反升, 跨时长准确率方差 (CDAV) 为 2.97。作为参考 (据 MINERVA 论文),Gemini 2.5 Pro (Thinking) 在 15 分钟以上视频中的准确率为 57.97%,GPT-4.1 为 47.25%, 而 VLX-VR 打破了行业在长视频理解领域的普遍瓶颈。

(图为 MINERVA 按时长准确率。VLX-VR 为红色菱形;其余为 MINERVA 论文 Fig. 3(c) 中的对照)

此次结果有其技术积累脉络。2025 年 2 月,OmAI 联汇在 GitHub 开源视觉推理模型 VLM-R1, 首次将 DeepSeek-R1 的强化学习推理框架引入视觉领域, 上线 48 小时登顶 GitHub 全球趋势榜。此后一年多时间里, 基于"-R1"范式的视觉推理工作在学术界持续推进。从 VLM-R1 到 VLX-VR, 同一只团队的研究方向从单帧视觉理解, 逐步延伸至长时序视频的推理——理解先后、理解因果、理解变化。作为该公司端侧流式多模态模型 VLX 家族的最新成员,VLX-VR 在 VLX「看见、看清、行动」的物理 AI 闭环之上, 进一步延展出面向长视频深度推理的「看懂」能力。

一张考卷背后的产业里程碑

在产业层面,VLX-VR 的发布恰逢中国机器人产业标准化进程加速的关键节点。8 月 24 日, 工信部公示《国家人形机器人产业标准体系建设指南 (2026 版)》征求意见稿, 明确将"类脑与智算"列为六大核心板块之一;8 月 26 日, 工信部在国新办"十五五"发布会上将具身智能列为未来产业方向。视频推理能力作为物理 AI 感知世界的基础能力, 其技术进展与产业需求的关联正在加深。

"物理 AI 正大规模走出实验室, 进入真实场景。"OmAI 联汇 CEO 赵天成此前在公开场合表示, 行业正迎来产业化、规模化拐点。当物理 AI 的"看懂"能力有了可测量的标准, 国产模型在国际权威基准上取得的成绩, 标志着中国在视频深度推理这一决定物理 AI 上限的核心能力上, 站到了全球前沿。

来源:互联网

免责声明:本文为转载,仅作信息分享交流之用。版权归原作者所有,如有侵权,请联系删除。

热门产品

解决方案

0311-85200850
在线咨询