Claude Opus 5 以 41.5% 领跑 ProgramBench
scaling01 · x · 2026-07-27
配图展示了 ProgramBench 的最新排名,重点是 Claude Opus 5 在编程任务上拿到新 SOTA:在 “Almost Resolved” 任务里准确率达到 41.5%。
- Claude Fable 5 以 33.0% 排名第二。
- GPT-5.6 Sol 以 23.0% 排名第三。
- 图里同时列出了 Claude Opus 4.8、Claude Sonnet 5、GPT 5.5 等模型,是一张典型的编码模型性能快照。
「模型」频道最新
- 本地部署的 Kimi K3 被指在物理模拟上胜过 GPT-5.6 — eyishazyer · 2026-07-28
- Reddit 讨论 KIMI-K3 通过 OpenRouter 是否仍有护栏 — Suhan_XD · 2026-07-28
- Kimi K3 的 1.6TB 权重背后,或是 20–40 万亿 tokens — johnseach · 2026-07-28
- Kimi K3 2.8 万亿开源模型冲击 Anthropic 200 美元订阅 — haider1 · 2026-07-28
- OpenAI 的“GPT-6”玩梗拿推理降本和效率提升开刀 — daniel_mac8 · 2026-07-28
- 回复称下一版 Codex 可能周二发布,Cerebras 也将跟进 — eyishazyer · 2026-07-28