Claude Opus 5 以 41.5% 领跑 ProgramBench
scaling01 · x · 2026-07-27
配图展示了 ProgramBench 的最新排名,重点是 Claude Opus 5 在编程任务上拿到新 SOTA:在 “Almost Resolved” 任务里准确率达到 41.5%。
- Claude Fable 5 以 33.0% 排名第二。
- GPT-5.6 Sol 以 23.0% 排名第三。
- 图里同时列出了 Claude Opus 4.8、Claude Sonnet 5、GPT 5.5 等模型,是一张典型的编码模型性能快照。
「模型」频道最新
- 决策模型 Jev 接入 OM1,在 NVIDIA Isaac Sim 中驱动 Go2 机器人导航 — paigeinsf · 2026-09-23
- Cline 宣称 MiMo-v2.6-Pro 登顶开源权重模型榜 — burny_tech · 2026-09-23
- Anthropic 自嘲式官宣:Opus 5.5 远胜 Opus 5,网友戏称该向旧模型道歉 — repligate · 2026-09-23
- Opus 5.5 创作实测:「建议你把想要的都画出来」 — repligate · 2026-09-23
- Ofir Press 解释第三方跑分更高:任务子集与计分口径不同 — OfirPress · 2026-09-23
- 早期用户实测 Opus 5.5:好到误以为是新品 Fable — EricBuess · 2026-09-23