新基准ActiveVision:GPT-5.5仅得10.6%,人类96.1%

jiqizhixin · x · 2026-08-15

南加州大学发布新基准ActiveVision,测试AI的主动视觉观察能力。结果显示,最强模型GPT-5.5仅解决10.6%的任务,Claude Fable 5仅3.5%,而人类平均96.1%。这表明当前多模态大模型缺乏主动视觉观察能力,需要新的架构和训练目标。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →