Claude Opus 5 在 FrontierCode 上以中等算力拿到 53.4% 和 63.6%
andrew_n_carr · x · 2026-07-25
这张图展示了 Claude Opus 5 在 FrontierCode 上的测试时算力缩放表现,主集和扩展集都给出了不同 reasoning effort 下的分数。
- 在主集上,Opus 5 在 medium effort 时达到最高 53.4%,图中显示它整体优于 Claude Opus 4.8,也和 GPT-5.6 Sol 同台对比。
- 在扩展集上,Opus 5 最高达到 63.6%,同样出现在中等 effort 附近,说明它的收益并不是简单“越算越好”,而是存在更合适的算力甜点区间。
这条帖子的核心意思是:Opus 5 是一个很强的编码模型,但最佳表现取决于给它多少推理预算。
所属事件:Anthropic 发布 Claude Opus 5,多项基准领先且价格减半(72 条相关)→
「模型」频道最新
- Claude Opus 5 综合登顶,Fable 5 仍领跑编程代理 — Hesamation · 2026-07-25
- Anthropic Opus 5 会在 59% 情况下写入结束对话理由 — Miles_Brundage · 2026-07-25
- Pi 通过动态模型目录自动上线 Opus 5 — mitsuhiko · 2026-07-25
- Opus 5 先摸清规则,再连过 ARC-AGI-3 多关 — GregKamradt · 2026-07-25
- Opus 5 提示词指南:别再显式要求自检了 — cedric_chee · 2026-07-25
- Claude Opus 5 已登陆 GitHub Copilot 的 App、CLI 和 VS Code — DanWahlin · 2026-07-25