ARC-AGI-3 Evaluation Framework Criticized for Memory Limits and Flawed Scoring
近期多位开发者对 ARC-AGI 3 基准测试的公平性与评测机制提出强烈质疑,认为当前的测试框架设计与评分规则严重失真,无法真实衡量通用人工智能的能力。
已确认
- 框架限制记忆:开发者 @Glittering-Neck-2505 与 @teortaxesTex 指出,当前的统一测试框架故意阻止推理智能体跨操作维护上下文,迫使模型不断“遗忘”。这种为了跨提供商标准化(使用相同的补全风格端点且不传回推理日志)而限制 Agent 长期记忆的做法,无法有效衡量模型的真实效率。
- 评分机制遭批:开发者 @mgostIH 发现,当前的测试框架已让 ARC-AGI-3 趋于饱和,只需对模型进行少量强化学习(RL)就能大幅提升分数。此外,他强烈批评该基准采用解题百分比的二次方计算,认为这毫无理由且纯属“造神”。
- 基础模型测试不公:ML Street Talk(经 @burnytech 转发)指出,现代 AI 本质上是混合神经符号系统,单次上下文的推理窗口不足以完成适应,因此直接用基础模型测试 ARC-AGI3 并不公平。
尚未确认
- 业界是否能就建立并采用统一的 Agent 框架来测试不同模型达成共识(目前仅为 ML Street Talk 提出的建议)。
为什么重要
- 影响基准公信力:如果测试机制容易被少量 RL 攻破并趋于饱和,且评分公式存在争议,那么该基准的权威性将大打折扣。
- 评测需贴合实际:开发者 @dkundel 与 @ilanbigio 的分析表明,合理追踪推理过程并使用上下文压缩机制对于跑出真实高分至关重要。这提醒业界,在设计跨平台标准化测试时,不应以牺牲 Agent 核心能力(如长期记忆)为代价。
2026-07-30 ~ 2026-07-30 · 5 related posts
Primary sources
- Reddit Debate: Is ARC-AGI 3 an Intentionally Dishonest Measure of AGI? — Glittering-Neck-2505 ·
- Dev Critiques ARC-AGI-3: Already Saturated, Quadratic Scoring Inflates Egos — mgostIH ·
- How Test Harness Design Impacts ARC-AGI-3 Scores — dkundel ·
- [source] How Test Harness Design Impacts ARC-AGI-3 Scores — dkundel · 2026-07-30
- [source] Reddit Debate: Is ARC-AGI 3 an Intentionally Dishonest Measure of AGI? — Glittering-Neck-2505 · 2026-07-30
- Agent Benchmark Harness Criticized: Gimping Long-Term Memory Skews Efficiency Tests — teortaxesTex · 2026-07-30
- [source] Dev Critiques ARC-AGI-3: Already Saturated, Quadratic Scoring Inflates Egos — mgostIH · 2026-07-30
- ML Street Talk: ARC-AGI3 Should Be Benchmarked with a Unified Agentic Harness — burny_tech · 2026-07-30