开发者吐槽 ARC-AGI-3 评分机制:已被刷爆,二次方计分纯属造神
mgostIH · x · 2026-07-30
开发者指出,当前的测试框架(harnesses)已经让 ARC-AGI-3 基准测试趋于饱和,只需对模型进行少量强化学习(RL)就能大幅提升分数。
此外,作者强烈批评了该基准测试的评分机制,认为其毫无理由地采用了解题百分比的二次方计算,仅仅是为了在初期大家都接近 0% 的情况下,人为夸大某些模型或个人的成绩。
所属事件:ARC-AGI 3测试机制遭开发者集体质疑(4 条相关)→
「研究」频道最新
- Hugging Face 研究员展示机器人触觉手套 v1 — RemiCadene · 2026-07-30
- 腾讯推 StatePlay 游戏世界模型:同步生成画面与游戏状态 — multimodalart · 2026-07-30
- 大模型强化学习泛化不足?研究员指优化方向或有误 — cjmaddison · 2026-07-30
- Robot Learning Paper Club 深度探讨 VLA 模型与英伟达 ASPIRE — DominiqueCAPaul · 2026-07-30
- ICML 论文揭示大模型底层缺陷:安全护栏极易被绕过 — ChuckDBrooks · 2026-07-30
- 构想 AGI-MATH 基准:让 AI 像科学家一样解谜逃逸 — Worldly_Beginning647 · 2026-07-30