Opus 5.5 实测汇总:修 20 万行代码库不到 3 小时,成本仅 GPT-6 Astra 五分之一
vista8 · x · 2026-09-23
中文博主汇总 Claude Opus 5.5 的基准与实测数据:
基准成绩
- Terminal-Bench 4.0:66.4%;FrontierCode v1.1:54.4%;CursorBench 4.0:57.8%,均领先 GPT-6 Astra 与 GPT-5.6 Sol。
- GDPval-AA v2.1(44 个职业真实工作评估):1846 Elo,高于 Fable 5.1 的 1735 和 Opus 5 的 1708。
编程效率
- 内测用户用 Opus 5.5 修复 20 万行代码库,不到 3 小时;Opus 5 花了 20 多小时、多 2.5 倍 token。
- Anthropic 内部让 Opus 5.5 与 Fable 5.1 把 HAProxy 从 C 翻译成 Rust:两者都通过回归测试,但 Opus 5.5 用 9.5 小时 vs 12 小时,成本低 51%。
- GitHub 实测:VS Code 中解决终端任务的步骤数不到 Opus 5 一半。
知识工作准确性
- 写季度业绩报告任务(数据来源藏得深,自动评分逐条核查):Opus 5.5 在 18 次尝试中通过 16 次;Fable 5.1 和 Opus 5 一次都没过。
成本与其他
- 缓存读取降 60%,利好 Agent;输出速度提升 30%+;默认设置表现超 GPT-6 Astra 最高设置,成本仅其五分之一。
所属事件:Opus 5.5 登顶 AA 智能指数,实测更快更便宜(23 条相关)→
「模型」频道最新
- 用户质疑 OpenAI Codex 新定价:两周内额度两日烧光 — cocktailpeanut · 2026-09-23
- 两项研究:AI 聊天机器人理财建议错误率高达 57%-85% — PtrPomorski · 2026-09-23
- 博主实测 GPT-6 Sol:任务从 1 小时缩到 20 分钟,token 省一半 — flavioAd · 2026-09-23
- Perplexity 官宣 GPT-6 Sol 接入,成 Computer 默认 Light 选项 — perplexity_ai · 2026-09-23
- Claude Opus 5.5 medium 更贵但几乎全面胜过 Astra — ChrisGPT · 2026-09-23
- Perplexity 全量上线 GPT-6 Sol:评测胜 Opus 5,价格仅五分之一 — AravSrinivas · 2026-09-23