Claude Opus 4.8 在 ProgramBench 上拿到 16.5% 新高
jyangballin · x · 2026-07-25
这条帖展示了 Claude Opus 4.8(xhigh)在 ProgramBench 上拿到的新成绩:"almost resolved" 指标达到 16.5%,创出新高。
- 图中把同一系列模型从 Opus 4.6、4.7、4.7-xhigh 一路对比到 4.8-xhigh,提升非常明显。
- ProgramBench 是一个代码重建基准,模型会自己判断何时完成任务,因此这里的指标强调的是“非常接近完全解决”的能力。
- 配图标题写的是 “More capable, not more effort”,暗示新模型不仅更强,而且在步数上也更高效。
所属事件:Claude Opus 4.8在ProgramBench创16.5%新高(3 条相关)→
「模型」频道最新
- Kimi K3 架构图公开,KDA 和 AttenRes 同时出现 — AccBalanced · 2026-07-25
- 用户称 200 美元 Codex 订阅太值,月付 OpenAI 已达 1200 美元 — robleclerc · 2026-07-25
- 一个 Qwen3.6-27B 合并模型把推理和编程融成 27B — pbaylies · 2026-07-25
- Google 仍索引提到 Claude Opus 5 的 Bedrock 文档 — Angaisb_ · 2026-07-25
- 用户实测 Laguna S2.1:规划太慢,但复杂调试很强 — Prudent-Objective852 · 2026-07-25
- Antirez 反驳“中国前沿模型主要靠蒸馏”说法 — antirez · 2026-07-25