Opus 5 在 ARC-AGI-3 上约拿到 30%
Dr_Singularity · x · 2026-07-25
这条帖子配图直接展示了 Opus 5 在 ARC-AGI-3 上的表现,图表标题是“Novel problem-solving by cost”。
图里的关键信息是:
- Opus 5 (high) 得分约 30%
- Opus 4.8 (high) 只有低个位数
- GPT-5.6 Sol 在更高评测成本下,分数仍处于 10% 以下
这张图强调的是“成本 vs 新问题解决能力”的权衡,目标不是常规刷榜,而是看模型面对陌生任务时的推理能力。
所属事件:Anthropic 发布 Claude Opus 5(35 条相关)→
「模型」频道最新
- Anthropic 推出 Claude Opus 5,定价仍是 $5/$25 — ctjlewis · 2026-07-25
- Claude Opus 5 在提示注入鲁棒性榜上接近满分 — EricBuess · 2026-07-25
- 用户调侃 Claude Opus 5 像 GPT-5,Anthropic 则强调 SOTA 成绩 — ChengleiSi · 2026-07-25
- Claude Opus 5 编程好用,但把 Compound Engineering 搞坏了 — danshipper · 2026-07-25
- Claude Opus 5 被描述为单任务更便宜、表现却很强 — EricBuess · 2026-07-25
- Anthropic 发布 Claude Opus 5,主打生物和化学能力 — gabepgomes · 2026-07-25