新基准揭示大模型视觉感知薄弱,准确率均未达 60%

The Decoder · rss · 2026-08-15

Moonshot AI 推出 PerceptionBench 基准,旨在将视觉感知与逻辑推理剥离,专门测试多模态模型的「看图」能力。测试结果显示,目前所有前沿模型表现均不佳,准确率均未达到 60%,GPT-5.6 Sol 仅以微弱优势领先。这表明许多被归咎于推理能力的错误,实际上在图像读取阶段就已经发生。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →