Opus 5 ARC-AGI-3 高分引造假质疑与评测反思
Claude Opus 5 在 ARC-AGI-3 基准测试中取得了 30.2% 的成绩,领先同侪 3 倍。然而这一高分随即在 AI 社区引发了广泛的造假质疑与争议,多名用户及业内人士对其真实能力表示怀疑,并引发了关于评测体系有效性的反思。
已确认
目前可以确认的是,Opus 5 的具体分数为 30.2%,且该成绩在业内引发了强烈的信任危机。网友 @sdnr8 质疑闭源模型不透明,认为其高分可能并非依赖“纯模型”能力,而是外部套用了 loop 或 harness 等代理框架。网友 @VraserX 则直接指责 Anthropic “作弊”,认为其专门针对该基准的谜题模式进行了特化训练,将视觉推理转化为明确的代数问题并反复演练。此外,自称来自前沿 AI 实验室的人员也向 @flowersslop 透露,该分数“看起来像假的”,要么是刷分过度,要么是竞争对手严重低估了 Anthropic 的领先幅度。Chris Szegedy (@ChrSzegedy) 与 @Dr_Singularity 均明确指出 ARC-AGI 跟 AGI 没什么关系,尽管后者承认 AI 确实在持续变强。
尚未确认
关于 Opus 5 是否真的使用了外部代理框架,或者 Anthropic 是否确实进行了针对性的特化训练,目前均停留在社区猜测与指控阶段,相关爆料并未提供实质性的技术证据。
为什么重要
此次争议不仅关乎 Anthropic 一家的声誉,更折射出业界对 AI 评测体系有效性的深层担忧。一方面,如 @morqon 转述的观点所指出的,过快饱和的评测会失去区分度,有人认为该基准在第一天就已接近“被解完”;另一方面,@burny_tech 转发的讨论表明,越来越多人默认 ARC-AGI 的进展主要来自针对性的 RL 环境,呼吁 ARC-AGI-4 减少公开演示以防止模型过拟合。这表明现有的公开基准测试正面临严峻的方法论挑战。
2026-07-25 ~ 2026-07-25 · 7 条相关
- 第 1 集:Claude Code 系统提示词大幅缩减 80%(2026-07-20,4 条)
- 第 2 集:逆向分析称Claude Code提示词实际缩减约70%(2026-07-22,2 条)
- 第 3 集:网传 Claude Opus 5 性能更强且价格减半(2026-07-23,3 条)
- 第 4 集:Anthropic 模型发布陷混乱,Opus 5 被指关乎成败(2026-07-23,2 条)
- 第 5 集:Anthropic发布Claude Opus 5,性能达SOTA且价格减半(2026-07-25,116 条)
- 第 6 集:网传 Anthropic 发布 Opus 5,支持加速与科研顶配(2026-07-25,3 条)
- 第 7 集:Claude Opus 5 早期测试:能力提升但破坏旧工作流(2026-07-25,8 条)
- 第 8 集:Anthropic发布Claude Opus 5实测表现亮眼(2026-07-25,3 条)
- 第 9 集:Opus 5 与 Fable 5 实测对比引发社区热议(2026-07-25,2 条)
- 第 10 集:Anthropic 砍掉 Claude Code 80% 系统提示词(2026-07-25,6 条)
- 第 11 集:Claude Opus 5 被指刷榜优化,实测仍落后(2026-07-25,2 条)
- 第 12 集:Claude Opus 5 创 ARC-AGI-3 纪录,展现代数推理新能力(2026-07-25,11 条)
- 第 13 集:Claude Opus 5 登顶多榜单成新 SOTA(2026-07-25,6 条)
- 第 14 集:Opus 5 编程测试反转:推理越强反而降分(2026-07-25,11 条)
- 第 15 集:Opus 5 ARC-AGI-3 高分引造假质疑与评测反思(2026-07-25,7 条)
- 第 16 集:传 Claude Opus 5 在 2026 IMO 斩获满分(2026-07-25,3 条)
- 第 17 集:Claude Opus 5 视觉评测落后且成本高昂(2026-07-25,4 条)
- 第 18 集:Claude Opus 5 提供五档推理强度并默认开启(2026-07-25,2 条)
- 第 19 集:Claude Opus 5 在 3D 物理场景测试中胜出(2026-07-25,2 条)
- 第 20 集:Claude Opus 5 登顶 OSWorld 2.0(2026-07-25,3 条)
一手来源
- Opus 5 在 ARC-AGI 3 得到 30.2%,但基准价值遭质疑 — ChrSzegedy ·
- 前沿实验室爆料称 Opus 5 的 ARC-AGI 3 分数像假的 — flowersslop ·
- 网友质疑 Anthropic 针对 ARC-AGI-3 评测进行特化训练 — VraserX ·
- Anthropic ARC-AGI-3 领先被质疑失去区分度 — morqon · 2026-07-25
- 【源头】网友质疑 Anthropic 针对 ARC-AGI-3 评测进行特化训练 — VraserX · 2026-07-25
- Reddit 质疑 Opus 5 的 ARC-AGI-3 高分是否来自循环框架 — sdnr8 · 2026-07-25
- 【源头】前沿实验室爆料称 Opus 5 的 ARC-AGI 3 分数像假的 — flowersslop · 2026-07-25
- ARC-AGI-4 或该减少公开演示,Opus 5 在 ARC-AGI-3 领先 3 倍 — burny_tech · 2026-07-25
- 【源头】Opus 5 在 ARC-AGI 3 得到 30.2%,但基准价值遭质疑 — ChrSzegedy · 2026-07-25
- 有人回应说 ARC-AGI 不是 AGI,但 AI 确实在持续变强 — Dr_Singularity · 2026-07-25