Claude Opus 4.8 用更少步骤拿到最佳 ProgramBench 成绩
jyangballin · x · 2026-07-25
这条回复补上了同一 ProgramBench 结果里的效率维度。
- 相比 GLM 5.2 和 Anthropic 更早的模型,Opus 4.8 是用更少的步骤拿到最佳分数的。
- 由于这个基准允许模型自己继续做下去直到主动停止,步数本身也反映了模型认为自己需要多少工作量。
- 图表传达的核心信息是:Opus 4.8 不只是更强,在这个设置下也更高效。
所属事件:Claude Opus 4.8在ProgramBench创16.5%新高(3 条相关)→
「模型」频道最新
- Notion 收购 ZeroEntropy,reranker 也开源成 Apache 2.0 — CShorten30 · 2026-07-25
- Anthropic 称 Opus 5 以半价逼近 Fable 5 基准表现 — dotey · 2026-07-25
- Opus 5 价格涨约 15%,但仍被视为 4.8 的严格升级 — bindureddy · 2026-07-25
- Fable 5.1 预计晚于 GPT-6,发布时间指向 8 月下旬到 9 月中旬 — zephyr_z9 · 2026-07-25
- ARC-AGI-3 图表显示 Opus 5 领先,但评测成本更高 — Angaisb_ · 2026-07-25
- Opus 5 比 4.8 明显更强,但“灵光”仍不如 Fable 5 — bindureddy · 2026-07-25