GPT-5.5 在 ActiveVision 仅得 10.6%,人类平均 96.1%

Justgototheeffinmoon · reddit · 2026-07-24

一篇新的 arXiv 论文用 ActiveVision 这个新基准测试前沿视觉模型,结果显示它们在“反复视觉感知”而不是“一次性描述”上仍然很弱。

论文强调,重点不只是“前沿视觉模型又翻车了”,而是这种失败模式很具体,而且模型无法通过自己写代码把这个问题补上。

所属事件:新基准 ActiveVision 揭示前沿视觉模型远落后于人类(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →