Claude Opus 5 在 DeepSWE 夺魁,号称成本还低 28%
daniel_mac8 · x · 2026-07-29
Claude Opus 5 的 DeepSWE 结果出炉后,这条帖把它直接称作“长时程编码智能体里最优的帕累托点”。
- 配图显示,Claude Opus 5 High 在 DeepSWE 上大约拿到 74%,位于图中最上方。
- 对比说法是:它在长任务编码上,能以大约 28% 更低的成本 跑赢 GPT-5.6 Sol Max。
- 这条内容的重点不是抽象讨论,而是具体模型在长上下文、持续修改、根据运行结果迭代这类编码 agent 场景里的成绩与性价比。
所属事件:Claude Opus 5 登顶 DeepSWE 长程编码评测(2 条相关)→
「编程与Agent」频道最新
- Recall 用情景记忆加速 RAG,命中仅 260 毫秒 — sharpeye_wnl · 2026-07-29
- 开发者把编码流程拆成 Opus 5 规划、M3 执行 — truecakesnake · 2026-07-29
- 一个小型 AI agent 用两道看门狗拦截生产前坏动作 — tushaarmehtaa · 2026-07-29
- 50 美元的 DJI 麦克风,让语音编程能在公共场合低声进行 — tdhopper · 2026-07-29
- Coding Agent 正在悄悄锁死项目早期决策 — bibryam · 2026-07-29
- Anthropic 工程师:Agent 要会自己提示自己 — blaizedsouza · 2026-07-29