Opus 5.5 刷新 Bug Hunt Bench 纪录,自检超 800 轮仍不罢工
PawelHuryn · x · 2026-09-29
Pawel Huryn 报告 Anthropic 新模型在 Bug Hunt Bench 上的表现刷新历史:
- Opus 5.5 (max):138–163 次模型调用,在最后 1 分钟内完成报告(n=3 中第 1 个 repo)。
- Sonnet 5 (max):207 轮交互。
- Sonnet 5.5 (max):执行风格截然不同——628 次模型调用,66 分钟时写出报告后仍在持续工作,111 分钟时已达 818 轮,反复自查代码。
作者称这是 Bug Hunt Bench 历史上从未见过的行为,最终报告可能非常出色,后续将在第二个 repo 评分后继续重复实验至 n=3。
所属事件:Anthropic Opus 5.5 刷新 Bug Hunt Bench 纪录(2 条相关)→
「编程与Agent」频道最新
- Anthropic 员工提醒:别把 Sonnet 拉满 effort,该用 Opus — edwinarbus · 2026-09-29
- Anthropic 员工:别把 Sonnet 开到 max effort,不如直接用 Opus — edwinarbus · 2026-09-29
- Hugging Face agent 攻击复盘:白名单限制去向,却管不住载荷 — kimmonismus · 2026-09-29
- Salesforce 工程师开源 PR Council MCP:多智能体代码评审实验场 — mostly_deterministic · 2026-09-29
- Moda 周报:自定义分类器以 1/30 成本超越 Opus 5.5 做用户挫败检测 — KlausCodes · 2026-09-29
- SpaceO 开源:给 AI Agent 配独立虚拟显示器,不再抢占你的 Mac 屏幕 — ParthJadhav · 2026-09-29