NTU/CMU/Berkeley 发布 VBVR-Pro:300 项可验证视觉推理任务基准
jiqizhixin · x · 2026-09-29
「原生视觉推理」(Native Visual Reasoning)正在受到关注:语言不再是唯一路径,模型可以直接感知、探索和更新视觉空间。但进展面临三个关键问题:
- 用什么任务训练模型进行视觉推理?
- 如何判断模型生成的图像/视频是否正确?
- 哪种模态(图像、视频、图文交错)最适合视觉推理?
没有可验证奖励,训练循环就没有可靠信号。NTU、CMU、Berkeley 等机构合作推出 VBVR-Pro(A Scalable and Verifiable Suite for Native Visual Reasoning),论文、数据、模型和代码全部开源。该套件定义了 300 个覆盖不同能力与复杂度的视觉推理任务,用其中 100 个构建基准,并为每个任务提供可验证的评分器,同时构建了 125 万条高质量训练样本。在匹配数据量下训练的模型……(原文截断)
所属事件:52 位学者发布 VBVR-Pro 视觉推理基准(3 条相关)→
「多模态」频道最新
- AI 真人化《龙珠》:悟饭与贝吉塔战人造人短片 — Old-Exchange-7586 · 2026-09-29
- 用 Claude Code 做出 hyperpop MV:约 4000 行代码逐帧重绘 — repligate · 2026-09-29
- Sonnet 5.5 Max 一条生成 60 秒 AI 编年史视频,跨度 1943–2026 — Successful-Earth678 · 2026-09-29
- 博主实测 Eleven v4:用自己的声音几乎去掉口音,配片由 Opus 5.5 制作 — ciguleva · 2026-09-29
- ElevenLabs 发布 Eleven v4:迄今最快、最富情感表现力的语音模型 — Polymarket · 2026-09-29
- 物理模拟全乐器演奏:LLM 驾驭萨克斯泛音列完成通排 — alexanderchen · 2026-09-29