新基准 ActiveVision 揭示前沿视觉模型远落后于人类
南加州大学研究者提出 ActiveVision 新基准,专门测试多模态大模型的“主动观察”能力。结果显示,前沿视觉模型在需要反复观察和主动寻找视觉证据的任务中表现极弱,例如 GPT-5.5 的完成率仅为 10.6%,而人类平均达到 96.1%。这表明当前模型在主动视觉感知方面仍存在严重不足。
2026-07-23 ~ 2026-07-24 · 3 条相关
- USC 基准显示 GPT-5.5 主动视觉观察仅得 10.6% — UniversityofSouthernCalifornia · 2026-07-23
- GPT-5.5 在 ActiveVision 仅得 10.6%,人类平均 96.1% — Justgototheeffinmoon · 2026-07-24
- ActiveVision 基准显示前沿视觉模型远落后于人类 — OfirPress · 2026-07-24