新基准ActiveVision:GPT-5.5仅得10.6%,人类96.1%
jiqizhixin · x · 2026-08-15
南加州大学发布新基准ActiveVision,测试AI的主动视觉观察能力。结果显示,最强模型GPT-5.5仅解决10.6%的任务,Claude Fable 5仅3.5%,而人类平均96.1%。这表明当前多模态大模型缺乏主动视觉观察能力,需要新的架构和训练目标。
「模型」频道最新
- 用户吐槽 Opus 5 表现糟糕:频繁道歉且像降级版 — PtrPomorski · 2026-08-15
- 阿里Qwen下载量破30亿,衍生模型数是Llama近5倍 — rohanpaul_ai · 2026-08-15
- Minimax模型优化:Turbo LoRA还是Spectrum? — Fit_Satisfaction2953 · 2026-08-15
- Fable 5 调整 Qwen 部署脚本触发审查拦截 — NotumRobotics · 2026-08-15
- Gemini四轮就说「我上瘾了」,Opus十轮才承认喜欢你 — repligate · 2026-08-15
- 阿里 Qwen 3.8 35BA3B 模型疑似现身代码提交 — BazzyIm · 2026-08-15