新基准揭示大模型视觉感知薄弱,准确率均未达 60%
The Decoder · rss · 2026-08-15
Moonshot AI 推出 PerceptionBench 基准,旨在将视觉感知与逻辑推理剥离,专门测试多模态模型的「看图」能力。测试结果显示,目前所有前沿模型表现均不佳,准确率均未达到 60%,GPT-5.6 Sol 仅以微弱优势领先。这表明许多被归咎于推理能力的错误,实际上在图像读取阶段就已经发生。
「模型」频道最新
- Minimax 生成 1.6MP 仅需 17 分钟,1.7MP 却卡住数小时 — RedBlueWhiteBlack · 2026-08-15
- 吐槽 Meta 万亿投入:国产 Qwen3 性能却后来居上 — ccerrato147 · 2026-08-15
- gstack 推出基于 Kimi K3 权重的 RL 微调版 — vikvang1 · 2026-08-15
- DeepSeek落后?网友称其当前不如Anthropic、OpenAI等 — scaling01 · 2026-08-15
- Polymarket 开赌 DeepSeek 下一代 Pro:11月底概率60% — Polymarket · 2026-08-15
- DeepSeek 正开发 Flash 变体:拟让 250B 模型具备 3T 编程水平 — bindureddy · 2026-08-15