视觉推理新基准:最强模型与人类差9倍,AI Coding Agent也翻车
机器之心 · wechat · 2026-08-05
南加州大学团队发布 ActiveVision 基准,专门测试多模态模型在复杂图像中的「主动观察」能力(如全局扫描、顺序追踪、属性迁移)。
核心评测结果:
- 纯 CoT 模型惨败:在不使用工具的情况下,表现最好的模型准确率仅为 10.6%,而人类平均达到 96.1%,差距近 9 倍。提高推理强度几乎无用,模型无法建立「获取证据-保存状态-回图验证」的闭环。
- Coding Agent 仍有差距:测试了 Fable5、GPT-5.5 等结合代码工具的 Agent,虽然分数显著上升(最高达 50.6%),但在需要持续追踪方向的任务上依然表现极差,且单题平均耗时 12-15 分钟、花费数美元,远逊于人类(约 34 秒)。
该基准通过程序生成精确拓扑结构并重绘为照片级图像,防止模型取巧,揭示了当前 AI 在持续视觉感知上的严重瓶颈。
「模型」频道最新
- 通义千问接入 Cline:5 美元特价订阅提供高性价比 API — Alibaba_Qwen · 2026-08-05
- 用户实测:中国大模型无系统提示词自报家门 — _TheWolfOfWalmart_ · 2026-08-05
- 头部大模型过度优化:指令遵循能力集体退化 — spleentastic · 2026-08-05
- MiniMax 向去审查 LoRA 作者发警告,违规将吊销 H3 模型许可 — Xto · 2026-08-05
- 实测对比:Qwen 3.8生成质量追平Fable 5且成本仅四成 — ChrisGPT · 2026-08-05
- 曝 GPT-5.6 Luna High 极速降价,开发者实测关注浏览器自动化能力 — petergyang · 2026-08-05