PerceptionBench 显示前沿多模态模型原子视觉感知未破 60%
moonshotai · hf · 2026-07-29
PerceptionBench 是一个评测多模态大模型 atomic visual perception 的基准。它试图把“感知错误”从“推理错误/知识错误”里剥离出来,用短而明确的问题单独测试某一种感知能力。
- 构建方式:基于对 42 个现有 benchmark 的失误分析。
- 规模:3000 道经过验证的问题,覆盖 10 种原子级感知能力。
- 结果:在 16 个前沿 MLLM 上,没有一个模型能达到 60% 准确率。
- 发现:与感知相关的幻觉是平均最弱项;总分相近并不代表能力结构相近。
- 意义:给视觉感知边界提供了更干净的诊断标准。
所属事件:月之暗面发布视觉感知基准 PerceptionBench(2 条相关)→
「多模态」频道最新
- RTX 5060 用户问能否本地微调 Krea 2 或 Chroma — Wide_Director_8897 · 2026-07-29
- Reddit 在问:现在最好用的换脸工作流是什么 — BeautifulStation4 · 2026-07-29
- Google Gemini Omni Flash 生成短视频约耗 90 credits — iamaliveix · 2026-07-29
- Microsoft 移除 Mage Flow,转向更高效的编码器 — Dante_77A · 2026-07-29
- 有人觉得 ChatGPT 生成的人像总是过度漂亮 — Complex-Poet-6809 · 2026-07-29
- Seedance 2.0 提示词把文生视频变成混乱执法镜头 — techhalla · 2026-07-29