Anthropic effort 档位与基准数据,给模型选择提供实用参考
seh0872 · reddit · 2026-07-24
Anthropic 的 effort 档位和基准数据,给选 Sonnet 还是 Opus 提供了实用参考
这条 Reddit 长帖整理了很多做 AI 团队/智能体工作流时会用到的信息。首先是 Anthropic 的 effort 档位:low / medium / high / xhigh / max,而 API 默认是 high。帖中特别提醒,effort 不只是影响“思考长度”,也会影响整条请求的行为,因为低 effort 往往连工具调用次数都会减少。
接着帖子对 Sonnet 5 和 Opus 4.8 做了多项基准对比,包括:
- SWE-bench Pro:63.2% vs. 69.2%
- Terminal-Bench 2.1:80.4% vs. 74.2%–82.7%
- OSWorld-Verified:81.2% vs. 约 83%
- GDPval-AA v2:1,618 Elo vs. 1,615 Elo
更关键的是一条更偏实践的结论:Anthropic 说 Opus 4.8 相比 Opus 4.7,漏掉代码缺陷而不提醒的概率大约低 4 倍。整体上,这篇帖子的意思不是“看分数选模型”这么简单,而是:在真实的 agentic 编程和 review 流程里,模型行为可能比单一 benchmark 更重要。
所属事件:Opus 5 编码测试反转:推理越强分数反而下滑(13 条相关)→
「编程与Agent」频道最新
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11