优化测试框架即破纪录,ARC-AGI-3 被指不能反映真实能力

Angaisb_ · x · 2026-07-30

有开发者指出,ARC-AGI-3 并不能真实代表模型的实际能力,因为通过优化测试框架(harness)就能轻易解决。

例如,仅通过两项设置更改——允许模型跨多个上下文窗口进行推理,并配合规范的上下文压缩(compaction)实现——就成功让 GPT-5.6 Sol 在 ARC-AGI-3 上达到了 SOTA(当前最优)水平。这进一步印证了测试工具链的优化对大模型评测分数的巨大影响。

所属事件:GPT-5.6开启特定API设置后ARC-AGI-3得分飙升3倍(10 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →