USC 基准显示 GPT-5.5 主动视觉观察仅得 10.6%

UniversityofSouthernCalifornia · hf · 2026-07-23

ActiveVision 发现多模态模型“主动观察”能力严重不足

来自南加州大学的研究者提出 ActiveVision,一个专门测量多模态大模型是否具备“主动观察”能力的基准。它包含 17 个任务、3 类场景,目标是逼迫模型反复感知,而不是只做一次静态描述。

论文还指出,这种差距不是“会不会写代码”那么简单:

作者的结论是:当前多模态大模型还不具备稳健的主动视觉观察能力,需要新的架构和训练目标来补上“感知—推理”闭环。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →