FrontierCode 显示 Claude Opus 5 在中等推理强度达到峰值
philhchen · x · 2026-07-25
- 这张图比较了 Claude Opus 5、Claude Opus 4.8、Claude Fable 5 和 GPT-5.6 Sol 在 FrontierCode v1.1 上的表现。
- 图里展示的是不同推理强度下的 test-time compute scaling,分别给出主集和扩展集的分数曲线。
- 在主集中,Claude Opus 5 的最好成绩是 53.4,出现在 medium 推理强度。
- 在扩展集中,它的最高分是 63.6,同样出现在 medium;继续加大推理强度并没有带来单调提升。
所属事件:Anthropic 发布 Claude Opus 5:性能达 SOTA 且价格减半(128 条相关)→
「编程与Agent」频道最新
- 零基础开发者自建分层记忆架构,仅 20k token 记住一年对话 — matteoianni · 2026-09-11
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 九年后端老兵:AI 代码不比人写的差,变糟的只是速率 — Sweaty-Landscape-561 · 2026-09-11
- 实测质疑 RTK 省 token 说法:成本基准显示并不成立 — michalwarda · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11