Opus 5 刷爆 ARC-AGI-3?遭硬核打假:疑似背诵答案而非真实推理
scaling01 · x · 2026-07-27
近日有报告称 Opus 5 在 ARC-AGI-3 基准测试中得分达 30%,远超前代。但本文引用深度分析指出,该测试子集(基于游戏《The Witness》的解谜机制)存在严重设计漏洞,本质上测的是“背诵”而非“推理”。
核心争议点:
- 缺乏交互反馈: 原版游戏中,玩家提交错误答案会获得线索反馈来学习规则;但在这个测试环境中,AI 提交答案后得不到任何反馈,丧失了探索学习的机制。
- 规则早已泄露: 《The Witness》是一款热门游戏,其底层逻辑规则在互联网上广泛存在。模型在预训练阶段极大概率已经“记住”了答案。
- 实测表现: 在消除了已知规则干扰的同等预算测试下,Opus 5 的得分与 Kimi K3、Fable 5 基本持平,并未展现出所谓的跨代提升。且追踪日志显示,Opus 5 在首次操作前就直接输出了隐藏规则,全程零探索,直接打出最优解。
「模型」频道最新
- Gemini 3.6 Flash 被看作能以低成本打 Sonnet 质量 — haider1 · 2026-07-27
- 用户吐槽 Opus 5 能力严重降级:满嘴胡言还算错题 — whatsallthiss · 2026-07-27
- Reddit 长文拆解 Kimi K3 背后的 MoE 和长上下文栈 — MohamedKadri_ · 2026-07-27
- Reddit 讨论本地编程模型怎么选,重点是规划和推理 — naunen · 2026-07-27
- GPT-5.6 Sol 在双仓库基准中修复 105 个隐藏 bug 里的 31 个 — PawelHuryn · 2026-07-27
- MineBench 指出 Opus 5.0 质量更强但成本高 64% — ENT_Alam · 2026-07-27