FrontierCode 显示 Claude Opus 5 在中等推理强度达到峰值
philhchen · x · 2026-07-25
- 这张图比较了 Claude Opus 5、Claude Opus 4.8、Claude Fable 5 和 GPT-5.6 Sol 在 FrontierCode v1.1 上的表现。
- 图里展示的是不同推理强度下的 test-time compute scaling,分别给出主集和扩展集的分数曲线。
- 在主集中,Claude Opus 5 的最好成绩是 53.4,出现在 medium 推理强度。
- 在扩展集中,它的最高分是 63.6,同样出现在 medium;继续加大推理强度并没有带来单调提升。
所属事件:Anthropic 发布 Claude Opus 5,多项基准测试领先(34 条相关)→
「编程与Agent」频道最新
- 新上下文工程指南称 Claude Code 系统提示词可删去 80% — EricBuess · 2026-07-25
- 有人直言:长周期自主 agent 被严重高估了 — ctjlewis · 2026-07-25
- Opus 5 评测显示,5-agent 编程团队到 0.6 分快 2.2 倍 — OfirPress · 2026-07-25
- Devin 接入 Claude Opus 5,FrontierCode 1.1 逼近 Fable 5 且成本减半 — _sholtodouglas · 2026-07-25
- 同一仓库跑一周后,三款编码 Agent 的翻车点很一致 — AIcademy-academy · 2026-07-25
- ChatGPT Work agent 现在能登录网站并保留会话 — OpenAIDevs · 2026-07-25