视觉推理新基准:最强模型与人类差9倍,AI Coding Agent也翻车

机器之心 · wechat · 2026-08-05

南加州大学团队发布 ActiveVision 基准,专门测试多模态模型在复杂图像中的「主动观察」能力(如全局扫描、顺序追踪、属性迁移)。

核心评测结果:

该基准通过程序生成精确拓扑结构并重绘为照片级图像,防止模型取巧,揭示了当前 AI 在持续视觉感知上的严重瓶颈。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →