Anthropic ARC-AGI-3 领先被质疑失去区分度
morqon · x · 2026-07-25
- 这条转述在质疑 Anthropic 对 ARC-AGI-3 的宣传:有人认为这个基准在第一天就已经接近“被解完”,因此即便某个模型分数更高,也未必说明真实能力有多大差距。
- 引用里的核心观点是:过快饱和的评测会失去区分度。当基准题目变得太容易时,模型之间的分数差可能不再反映实际应用中的能力差异。
- 这条信息的重点不在单个分数,而在于:公开 benchmark 一旦被模型迅速追平,评测本身就会很快过时。
「模型」频道最新
- Moonshot 旗下 Kimi K3 模型即将发布,Baseten 提供 25 美元免费额度 — baseten · 2026-07-25
- Claude Opus 5 据报在 2026 IMO 拿下 42/42 满分 — exordin26 · 2026-07-25
- Claude Opus 5 上线,Box 说企业 agent 任务大幅提升 — inductionheads · 2026-07-25
- 有人直言 Gemini 3.5 Pro 已经太晚难竞争 — teortaxesTex · 2026-07-25
- Claude Opus 5 进入 GitHub Copilot 和 Microsoft Foundry — DanWahlin · 2026-07-25
- Hyperagent:Opus 5 更强,但 GPT-5.6 Sol 更便宜更好落地 — TawohAwa · 2026-07-25