视频推理模型 VLX-VR 实测:看懂塞斯纳起落架传动,MINERVA 拿 78.8% 居首
卡尔的AI沃茨 · wechat · 2026-09-10
作者用 GPT6 生成的塞斯纳 337 起落架收放 3D 演示视频做测试,检验 OmAI 联汇新发布的视频深度推理模型 VLX-VR。
- 机械验证:模型完整复述了传动链、齿轮齿条啮合、液压作动筒与 over-center 过死点自锁的机理,结论是没有物理错误——没有像「看图说话」模型那样顺着提问硬凑毛病。
- 因果推演:追问「第 2 分钟自锁未到位会怎样」时,模型能沿时间线推演后续后果,说明理解动作间的连锁反应。
- 基准成绩:在含 1000+ 道长视频推理题、要求提交推理轨迹的 MINERVA 基准上拿到 78.8% 排公开第一,对比 o1 的 43.48%、GPT-4o 的 45.54%、Gemini 2.5 Pro(15 分钟以上长视频)的 57.97%。答对题的推理步骤一致率达 96.2%,且 5 分钟以下到 15 分钟以上三档准确率不降反升(76.70%/78.73%/80.92%),人类基准为 92.54%。
- 短板:密集微小零件清点、微弱局部形变等场景仍会出错。
- 延伸实测:9 倍速压缩的工业建模屏幕录制中,模型捕捉到第 11 秒的 CreateBlock1 AttributeError 报错,识别出全程为 PythonJournal 脚本自动化建模,并数出 22 个实体、给出精确尺寸;四宫格机械臂实验视频里能区分人工示教与机械臂实操的节奏差异。
- 产品落地:基于 VLX-VR 的视频创作 Agent「OttoBox 小欧」可从海量素材中定位画面、理解动作与情绪,30 分钟出粗剪(原人工需 8-10 小时),且本地端侧运行。
「多模态」频道最新
- 博主分享 4 个 Midjourney V6 最爱风格码 --sref 直接可用 — michaelrabone · 2026-09-11
- AI 音乐视频《Parfumu pe Piele》实现照片级真实感 — Smart-Proof-1861 · 2026-09-11
- 6 组高难度提示词对比 GPT Image 2.0 与 2.5,纹理差距明显 — FinanceYF5 · 2026-09-11
- ComfyUI 真 10bit 视频输出的隐藏 8bit 瓶颈 — robertwellesley · 2026-09-11
- MiniMax H3 实测:首帧图 1:2 出 1:2 视频,时间凝滞效果惊艳 — Hailuo_AI · 2026-09-11
- 用Codex生成Remotion动效再喂给MiniMax H3出片 — Hailuo_AI · 2026-09-11