开发者吐槽 ARC-AGI-3 评分机制:已被刷爆,二次方计分纯属造神

mgostIH · x · 2026-07-30

开发者指出,当前的测试框架(harnesses)已经让 ARC-AGI-3 基准测试趋于饱和,只需对模型进行少量强化学习(RL)就能大幅提升分数。

此外,作者强烈批评了该基准测试的评分机制,认为其毫无理由地采用了解题百分比的二次方计算,仅仅是为了在初期大家都接近 0% 的情况下,人为夸大某些模型或个人的成绩。

所属事件:ARC-AGI 3测试机制遭开发者集体质疑(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →