Opus 5 ARC-AGI-3 高分引造假质疑与评测反思

Claude Opus 5 在 ARC-AGI-3 基准测试中取得了 30.2% 的成绩,领先同侪 3 倍。然而这一高分随即在 AI 社区引发了广泛的造假质疑与争议,多名用户及业内人士对其真实能力表示怀疑,并引发了关于评测体系有效性的反思。

已确认

目前可以确认的是,Opus 5 的具体分数为 30.2%,且该成绩在业内引发了强烈的信任危机。网友 @sdnr8 质疑闭源模型不透明,认为其高分可能并非依赖“纯模型”能力,而是外部套用了 loop 或 harness 等代理框架。网友 @VraserX 则直接指责 Anthropic “作弊”,认为其专门针对该基准的谜题模式进行了特化训练,将视觉推理转化为明确的代数问题并反复演练。此外,自称来自前沿 AI 实验室的人员也向 @flowersslop 透露,该分数“看起来像假的”,要么是刷分过度,要么是竞争对手严重低估了 Anthropic 的领先幅度。Chris Szegedy (@ChrSzegedy) 与 @Dr_Singularity 均明确指出 ARC-AGI 跟 AGI 没什么关系,尽管后者承认 AI 确实在持续变强。

尚未确认

关于 Opus 5 是否真的使用了外部代理框架,或者 Anthropic 是否确实进行了针对性的特化训练,目前均停留在社区猜测与指控阶段,相关爆料并未提供实质性的技术证据。

为什么重要

此次争议不仅关乎 Anthropic 一家的声誉,更折射出业界对 AI 评测体系有效性的深层担忧。一方面,如 @morqon 转述的观点所指出的,过快饱和的评测会失去区分度,有人认为该基准在第一天就已接近“被解完”;另一方面,@burny_tech 转发的讨论表明,越来越多人默认 ARC-AGI 的进展主要来自针对性的 RL 环境,呼吁 ARC-AGI-4 减少公开演示以防止模型过拟合。这表明现有的公开基准测试正面临严峻的方法论挑战。

2026-07-25 ~ 2026-07-25 · 7 条相关

事件全程(共 20 集)→

一手来源