Anthropic Opus 5 在 ARC-AGI-3 达 30%,但盲测没拉开差距

NathanpmYoung · x · 2026-07-27

Anthropic 被指在 ARC-AGI-3 上“刷榜”式提升:据帖中引述,Opus 5 拿到 30%,约是上一最佳的 4 倍、也是 Opus 4.8 的 20 倍。

但在作者们自建的 Witness 盲测套件里,这个提升并没有迁移:

作者的结论是,Opus 5 在某些题型里像是“已经见过这个游戏”:它甚至会在第一步前直接说出隐藏规则,并在温度 1.0 下 5/5 次给出字节级一致的最优解,说明更像是熟悉题型而非真正的代际跃迁。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →