Anthropic 用 ARC-AGI-3 测 Opus 5 新推理能力
typewriters · x · 2026-07-25
Anthropic 正在用 ARC-AGI-3 来衡量 Opus 5 的新问题解决能力。
配图给出的是一张“总评测成本 vs 得分”的散点图:
- Opus 5 (high) 约在 30% 左右
- Opus 4.8 (high) 只有低个位数
- GPT-5.6 Sol 也在 10% 以下,但评测成本更高
这条信息的重点不是单纯刷分,而是把 ARC-AGI-3 作为一种更偏“新颖推理/未知任务解决”能力的前沿测评。
所属事件:Anthropic 发布 Claude Opus 5(35 条相关)→
「模型」频道最新
- Anthropic 发布 Claude Opus 5,主打生物和化学能力 — gabepgomes · 2026-07-25
- Claude Opus 5 连自家系统卡都拒绝引用,版权边界很严 — peterwildeford · 2026-07-25
- Nvidia 将在直播中解析 Nemotron 3 Ultra 开源模型 — yacinelearning · 2026-07-25
- Claude Opus 5 在 LiveBench 逼近前排,实测仍落后 Fable 5 — bindureddy · 2026-07-25
- 有人调侃 Opus 5 只比 Fable 5 强一点,但价格砍半 — dejavucoder · 2026-07-25
- Every 对 Opus 5 转向负评,上月还在夸 Opus 4.8 — soumitrashukla9 · 2026-07-25