ARC Prize 证实 Opus 5.5 跑分:ARC-AGI-2 达 93.3%,成本降八成
burny_tech · x · 2026-09-23
ARC Prize 官方公布 Anthropic Opus 5.5 在 ARC-AGI (Verified) 上的成绩:ARC-AGI-2 得分 93.3%($0.41/任务),ARC-AGI-1 得分 98.5%($0.16/任务)。相比 Opus 5,v2 提升 2.9 个百分点、v1 提升 1.0 个百分点,而评测成本约为原来的五分之一(下降约 80%)。
「模型」频道最新
- 130 小时、750 亿 token、260 万美元,一次 RL 训练的真实账单 — burny_tech · 2026-09-23
- 单张 4090 跑 Qwen 27B 三天长会话,输出卡死在无尽斜杠 — Tiny-Entertainer-346 · 2026-09-23
- Claude网页与桌面端上线用量额度重置按钮 — airesearch12 · 2026-09-23
- 第三方实测:Claude Opus 5.5 出图更精细,成本却是 GPT-6 Sol 的 13 倍 — testingcatalog · 2026-09-23
- 实测者称 Claude Opus 5.5 拥有迄今最佳视觉设计能力 — burny_tech · 2026-09-23
- GPT-6 Sol Codex 系统提示词泄露,全文超 29.4 万字符 — gaganghotra_ · 2026-09-23