防大模型「背题」:新基准 REKEY 揭露视觉模型分数虚高

jiqizhixin · x · 2026-08-14

当前 AI 评测常面临训练数据污染(即“背题”)问题,导致模型分数虚高。为此,研究人员提出了 REKEY 基准。

REKEY 通过在测试时随机替换真实图像中的关键细节,迫使模型真正去“看图”理解,而不是仅凭记忆作答。在 8 个顶级视觉语言模型的测试中,相比传统评测,这些模型在 REKEY 上的分数下降了 9.5 到 18.8 分,直观证明了数据污染带来的能力高估。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →