开放评测挑战称 Opus 5 的 ARC-AGI-3 提升并未转移
rbhar90 · x · 2026-07-25
作者主张要有更多开放、可复核的基准测试,因为前沿实验室的“强推理能力”叙事已经和巨大的商业利益绑得太紧。
文中引用了 Opus 5 在 ARC-AGI-3 与作者自建的 Witness 测试集上的对比:
- Opus 5 在 ARC-AGI-3 上据称达到 30%,明显领先此前模型。
- 但在 Witness 上,这种提升没有转移:Opus 5 得分 43.4 ± 3.2,与 kimi-k3(42.8 ± 1.9)和 Fable-5(43.8 ± 9.7)几乎打平。
- 它确实高于 Opus 4.8(34.8),但作者认为这并不是“代际跃升”。
- 轨迹分析显示,Opus 5 似乎已经“认识”这类谜题:它会在第一步之前先说出隐藏规则,并在温度 1.0、5 个种子下都走出字节级一致的最优解,几乎没有探索。
核心结论是:如果真实任务分布与评测集不一致,单一基准分数可能会高估推理能力的进步。
所属事件:Opus 5 ARC-AGI-3 高分引发造假与过拟合争议(11 条相关)→
「模型」频道最新
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11
- TheZhi 发起调查:Fable 5.1 与 Astra 发布后,编码模型选择变了吗 — TheZvi · 2026-09-11