Opus 5 ARC-AGI-3 高分引发造假与过拟合争议
Claude Opus 5 在 ARC-AGI-3 基准测试中取得了 30.2% 的成绩,领先同侪 3 倍。然而这一高分随即在 AI 社区引发广泛的造假与过拟合质疑,多名用户及业内人士对其真实能力表示怀疑,并引发了关于评测体系有效性与商业利益绑定的反思。
已确认
目前可以确认的是,Opus 5 的具体分数为 30.2%,且该成绩在业内引发了强烈的信任危机。网友 @sdnr8 质疑闭源模型不透明,认为其高分可能并非依赖“纯模型”能力,而是外部套用了 loop 或 harness 等代理框架。网友 @VraserX 则直接指责 Anthropic “作弊”,认为其专门针对该基准的谜题模式进行了特化训练,将视觉推理转化为明确的代数问题并反复演练。此外,自称来自前沿 AI 实验室的人员也向 @flowersslop 透露,该分数“看起来像假的”,要么是刷分过度,要么是竞争对手严重低估了 Anthropic 的领先幅度。Chris Szegedy (@ChrSzegedy) 与 @DrSingularity 均明确指出 ARC-AGI 跟 AGI 没什么关系,尽管后者承认 AI 确实在持续变强。Gary Marcus 也发声强调,在基准上刷分并不等于接近 AGI,他认为分数提升更可能源于定向优化而非抽象推理能力的真正泛化。
尚未确认
关于 Opus 5 是否真的使用了外部代理框架,或者 Anthropic 是否确实进行了针对性的特化训练,目前均停留在社区猜测与指控阶段,相关爆料并未提供实质性的技术证据。
为什么重要
此次争议不仅关乎 Anthropic 一家的声誉,更折射出业界对 AI 评测体系有效性的深层担忧。一方面,如 @morqon 转述的观点所指出的,过快饱和的评测会失去区分度,有人认为该基准在第一天就已接近“被解完”;另一方面,@burnytech 转发的讨论表明,越来越多人默认 ARC-AGI 的进展主要来自针对性的 RL 环境,呼吁 ARC-AGI-4 减少公开演示以防止模型过拟合。@JasonBotteril 也指出,将基准直接命名为 AGI 几乎注定会诱导实验室去针对性优化。此外,@rbhar90 强调前沿实验室的“强推理能力”叙事已与巨大商业利益深度绑定,主张建立更多开放、可复核的基准测试(如自建的 Witness 测试集),并指出 Opus 5 在 ARC-AGI-3 上的提升并未转移到其他测试集中。@inductionheads 也指出,如果模型确实在类似 ARC-AGI 的强化学习环境里训练过,那么其表现便无法证明“通用泛化”。这表明现有的公开基准测试正面临严峻的方法论挑战。
2026-07-25 ~ 2026-07-27 · 11 条相关
- 第 1 集:Opus 5 ARC-AGI-3 高分引发造假与过拟合争议(2026-07-25,11 条)
- 第 2 集:深扒 Opus 5 隐藏推理机制与 ARC-AGI 成绩(2026-07-25,2 条)
- 第 3 集:Anthropic 基准测试表现引发社区信任危机(2026-07-25,2 条)
- 第 4 集:Gary Marcus 批评 ARC-AGI 命名易误导大众(2026-07-27,2 条)
- 第 5 集:前沿AI评测缺失人类基准,人机协同评估成新焦点(2026-07-29,4 条)
- 第 6 集:优化记忆管理设置,GPT-5.6 在 ARC-AGI-3 跑分翻三倍(2026-07-30,27 条)
- 第 7 集:ARC-AGI 3评测机制遭开发者集体质疑(2026-07-30,9 条)
- 第 8 集:Claude Opus的ARC-AGI高分被指受API实现影响(2026-07-30,2 条)
- 第 9 集:ARC-AGI-3评测规则澄清与官方代码库开源(2026-07-30,5 条)
一手来源
- Opus 5 在 ARC-AGI 3 得到 30.2%,但基准价值遭质疑 — ChrSzegedy ·
- Gary Marcus:基准提升不等于接近 AGI — GaryMarcus ·
- Reddit 质疑 Opus 5 的 ARC-AGI-3 高分是否来自循环框架 — sdnr8 ·
- Anthropic ARC-AGI-3 领先被质疑失去区分度 — morqon · 2026-07-25
- 网友质疑 Anthropic 针对 ARC-AGI-3 评测进行特化训练 — VraserX · 2026-07-25
- 【源头】Reddit 质疑 Opus 5 的 ARC-AGI-3 高分是否来自循环框架 — sdnr8 · 2026-07-25
- 前沿实验室爆料称 Opus 5 的 ARC-AGI 3 分数像假的 — flowersslop · 2026-07-25
- ARC-AGI-4 或该减少公开演示,Opus 5 在 ARC-AGI-3 领先 3 倍 — burny_tech · 2026-07-25
- 【源头】Opus 5 在 ARC-AGI 3 得到 30.2%,但基准价值遭质疑 — ChrSzegedy · 2026-07-25
- 有人回应说 ARC-AGI 不是 AGI,但 AI 确实在持续变强 — Dr_Singularity · 2026-07-25
- 开放评测挑战称 Opus 5 的 ARC-AGI-3 提升并未转移 — rbhar90 · 2026-07-25
- Anthropic 的 Opus 5 触发 ARC-AGI 泛化争议 — inductionheads · 2026-07-25
- 【源头】Gary Marcus:基准提升不等于接近 AGI — GaryMarcus · 2026-07-27
- 一个以 AGI 命名的 benchmark,可能注定会被针对性优化 — JasonBotterill · 2026-07-27