Anthropic Opus 5 在 ARC-AGI-3 达 30%,但盲测没拉开差距
NathanpmYoung · x · 2026-07-27
Anthropic 被指在 ARC-AGI-3 上“刷榜”式提升:据帖中引述,Opus 5 拿到 30%,约是上一最佳的 4 倍、也是 Opus 4.8 的 20 倍。
但在作者们自建的 Witness 盲测套件里,这个提升并没有迁移:
- Opus 5:43.4 ± 3.2
- kimi-k3:42.8 ± 1.9
- Fable-5:43.8 ± 9.7
- Opus 4.8:34.8
作者的结论是,Opus 5 在某些题型里像是“已经见过这个游戏”:它甚至会在第一步前直接说出隐藏规则,并在温度 1.0 下 5/5 次给出字节级一致的最优解,说明更像是熟悉题型而非真正的代际跃迁。
「模型」频道最新
- 转发称:认真对待 Opus 3 本身就是一种超能力 — repligate · 2026-07-27
- Reddit 讨论:Qwen 更该做 27B 到 397B 模型 — Responsible_Fig_1271 · 2026-07-27
- 模型图表对比 Opus 5、Sonnet 5 与 GPT-5.6 成本和编码分数 — haider1 · 2026-07-27
- Sam Altman 说未来六个月模型进展将快过过去两年 — ycombinator · 2026-07-27
- 有人想把编码模型订到每月 5 美元,能打赢 20 美元档吗 — athsrva · 2026-07-27
- 有人称 Kimi 短期走势取决于 K3 基座模型发布 — _xjdr · 2026-07-27