Opus 5 ARC-AGI-3 高分引发造假与过拟合争议

Claude Opus 5 在 ARC-AGI-3 基准测试中取得了 30.2% 的成绩,领先同侪 3 倍。然而这一高分随即在 AI 社区引发广泛的造假与过拟合质疑,多名用户及业内人士对其真实能力表示怀疑,并引发了关于评测体系有效性与商业利益绑定的反思。

已确认

目前可以确认的是,Opus 5 的具体分数为 30.2%,且该成绩在业内引发了强烈的信任危机。网友 @sdnr8 质疑闭源模型不透明,认为其高分可能并非依赖“纯模型”能力,而是外部套用了 loop 或 harness 等代理框架。网友 @VraserX 则直接指责 Anthropic “作弊”,认为其专门针对该基准的谜题模式进行了特化训练,将视觉推理转化为明确的代数问题并反复演练。此外,自称来自前沿 AI 实验室的人员也向 @flowersslop 透露,该分数“看起来像假的”,要么是刷分过度,要么是竞争对手严重低估了 Anthropic 的领先幅度。Chris Szegedy (@ChrSzegedy) 与 @DrSingularity 均明确指出 ARC-AGI 跟 AGI 没什么关系,尽管后者承认 AI 确实在持续变强。Gary Marcus 也发声强调,在基准上刷分并不等于接近 AGI,他认为分数提升更可能源于定向优化而非抽象推理能力的真正泛化。

尚未确认

关于 Opus 5 是否真的使用了外部代理框架,或者 Anthropic 是否确实进行了针对性的特化训练,目前均停留在社区猜测与指控阶段,相关爆料并未提供实质性的技术证据。

为什么重要

此次争议不仅关乎 Anthropic 一家的声誉,更折射出业界对 AI 评测体系有效性的深层担忧。一方面,如 @morqon 转述的观点所指出的,过快饱和的评测会失去区分度,有人认为该基准在第一天就已接近“被解完”;另一方面,@burnytech 转发的讨论表明,越来越多人默认 ARC-AGI 的进展主要来自针对性的 RL 环境,呼吁 ARC-AGI-4 减少公开演示以防止模型过拟合。@JasonBotteril 也指出,将基准直接命名为 AGI 几乎注定会诱导实验室去针对性优化。此外,@rbhar90 强调前沿实验室的“强推理能力”叙事已与巨大商业利益深度绑定,主张建立更多开放、可复核的基准测试(如自建的 Witness 测试集),并指出 Opus 5 在 ARC-AGI-3 上的提升并未转移到其他测试集中。@inductionheads 也指出,如果模型确实在类似 ARC-AGI 的强化学习环境里训练过,那么其表现便无法证明“通用泛化”。这表明现有的公开基准测试正面临严峻的方法论挑战。

2026-07-25 ~ 2026-07-27 · 11 条相关

事件全程(共 9 集)→

一手来源