Opus 5 刷爆 ARC-AGI-3?遭硬核打假:疑似背诵答案而非真实推理

scaling01 · x · 2026-07-27

近日有报告称 Opus 5 在 ARC-AGI-3 基准测试中得分达 30%,远超前代。但本文引用深度分析指出,该测试子集(基于游戏《The Witness》的解谜机制)存在严重设计漏洞,本质上测的是“背诵”而非“推理”。

核心争议点:

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →