ARC-AGI 3测试机制遭开发者集体质疑
多位开发者发文质疑ARC-AGI 3基准测试的公平性与有效性。批评指出,该测试框架存在记忆重置缺陷,且为保持跨平台一致性而禁用长期记忆、不传回推理日志,导致无法真实反映模型效率。此外,测试已被少量强化学习刷爆趋于饱和,其二次方计分机制更被斥为“纯属造神”。原作者对此回应称,统一框架是为了确保对比的公平性。
2026-07-30 ~ 2026-07-30 · 4 条相关
- 实测 ARC-AGI-3:测试框架设计显著影响模型得分 — dkundel · 2026-07-30
- Reddit热议:ARC-AGI 3测试机制被指严重失真 — Glittering-Neck-2505 · 2026-07-30
- Agent评测框架被指存在缺陷:禁用长期记忆难反映真实效率 — teortaxesTex · 2026-07-30
- 开发者吐槽 ARC-AGI-3 评分机制:已被刷爆,二次方计分纯属造神 — mgostIH · 2026-07-30