开放评测挑战称 Opus 5 的 ARC-AGI-3 提升并未转移
rbhar90 · x · 2026-07-25
作者主张要有更多开放、可复核的基准测试,因为前沿实验室的“强推理能力”叙事已经和巨大的商业利益绑得太紧。
文中引用了 Opus 5 在 ARC-AGI-3 与作者自建的 Witness 测试集上的对比:
- Opus 5 在 ARC-AGI-3 上据称达到 30%,明显领先此前模型。
- 但在 Witness 上,这种提升没有转移:Opus 5 得分 43.4 ± 3.2,与 kimi-k3(42.8 ± 1.9)和 Fable-5(43.8 ± 9.7)几乎打平。
- 它确实高于 Opus 4.8(34.8),但作者认为这并不是“代际跃升”。
- 轨迹分析显示,Opus 5 似乎已经“认识”这类谜题:它会在第一步之前先说出隐藏规则,并在温度 1.0、5 个种子下都走出字节级一致的最优解,几乎没有探索。
核心结论是:如果真实任务分布与评测集不一致,单一基准分数可能会高估推理能力的进步。
所属事件:Opus 5 刷爆 ARC-AGI-3 引发热议与造假质疑(11 条相关)→
「模型」频道最新
- GLM-5.2 在 RTX 5090 上推理提速至 80–110 tok/s — markjeffrey · 2026-07-27
- Grok Build 新增 /deep-research 并行研究与引文报告 — elonmusk · 2026-07-27
- 对大多数用户来说,开源本地模型比前沿系统更重要 — sull · 2026-07-27
- Claude Opus 5 一次生成通过滑雪者测试 — rohanpaul_ai · 2026-07-27
- GPT 5.6 Pro 被指比 Work/Codex 高档位更强 — latticecut · 2026-07-27
- 开发者称 Codex 已成自己在 ChatGPT 里的编程环境 — kevinkern · 2026-07-27