防大模型「背题」:新基准 REKEY 揭露视觉模型分数虚高
jiqizhixin · x · 2026-08-14
当前 AI 评测常面临训练数据污染(即“背题”)问题,导致模型分数虚高。为此,研究人员提出了 REKEY 基准。
REKEY 通过在测试时随机替换真实图像中的关键细节,迫使模型真正去“看图”理解,而不是仅凭记忆作答。在 8 个顶级视觉语言模型的测试中,相比传统评测,这些模型在 REKEY 上的分数下降了 9.5 到 18.8 分,直观证明了数据污染带来的能力高估。
「研究」频道最新
- 陶哲轩借 AI 辅助证明 Sendov 猜想,Lean 形式化已完成 — stevenstrogatz · 2026-08-14
- ARC 基准测试:模型原生能力正逐渐吸收外部工具脚本 — mhmazur · 2026-08-14
- 具身智能盲区:9款VLM懂修车但不会主动发现问题 — rohanpaul_ai · 2026-08-14
- Anthropic 研究员:一年内大模型将彻底攻克 Lean 形式化验证 — geoffreyirving · 2026-08-14
- Kevin Murphy 独作论文:用大模型与贝叶斯实现高效科学发现 — burny_tech · 2026-08-14
- 用人脑细胞做计算?Synthetic Biological Intelligence CEO 提出颠覆性算力能效方案 — bosmeny · 2026-08-14