FrontierCode 测试显示 Opus 5 在 medium 档最好
量子位 · wechat · 2026-07-27
Opus 5 在 medium 档反而跑得最好
有人用 FrontierCode 编程基准把 Claude Opus 5 的推理强度从 low 扫到 max,结果发现一条很反直觉的曲线:medium 才是性能峰值,把档位拉到最高并没有带来更好效果,甚至可能变差。
- 文章强调,这里的 effort 更像是推理预算,不是模型“智商”本身。
- 对信息提取、分类、文档撰写这类简单任务,low 和 high 的质量差异并不大。
- 在编程场景里,尤其是只修几行 bug 的小问题,高档位会让模型“加戏”:顺手重构无关代码、改导入、重命名变量,把小补丁扩成完整 PR。
- Anthropic 自己的提示词指南也在劝用户:只要质量不掉,就尽量用 low / medium 压成本和延迟,把高档位留给真正复杂的长周期任务。
- 另一个容易忽略的点是:effort 档位会影响缓存匹配,中途切档可能清空上下文缓存,导致整体成本反而上升。
文章给出的实操建议是:按工作流固定一个档位,全程别乱切。对很多结构化任务来说,最舒服的平衡点并不是 max,而是 medium。
「编程与Agent」频道最新
- 实操演示:AI agents 正在自动化 2026 年的 SDLC — Pavan_Belagatti · 2026-07-27
- 检索、推理与执行应分层:多智能体架构的避坑思考 — Harshit-24 · 2026-07-27
- 看着 10 个 RPA 机器人跑小红书,像听见婴儿出生 — huangyun_122 · 2026-07-27
- Go 版安全扫描分流 Agent 实测:能降噪但仍需人工复核 — coldyx · 2026-07-27
- Claude Sonnet 接入 SEO API 后被多域名 SERP 撑爆上下文 — MaTT_fromIT · 2026-07-27
- 开发者公开 1.7 万条记忆的 Claude harness 方案 — supermegasaurusrex · 2026-07-27