新基准 ActiveVision 揭示前沿视觉模型远落后于人类

南加州大学研究者提出 ActiveVision 新基准,专门测试多模态大模型的“主动观察”能力。结果显示,前沿视觉模型在需要反复观察和主动寻找视觉证据的任务中表现极弱,例如 GPT-5.5 的完成率仅为 10.6%,而人类平均达到 96.1%。这表明当前模型在主动视觉感知方面仍存在严重不足。

2026-07-23 ~ 2026-07-24 · 3 条相关