自建盲测:Sonnet 5.5 正确率追平 Opus 5.5,价格仅四分之一
_Duex · reddit · 2026-09-29
作者用同一个自包含任务横向实测新发布的 Sonnet 5.5 与 Opus 5.5(另加 GPT-6 Sol/Luna 对照):从零写一个 Rust 版 DEFLATE/zlib 解压器,无依赖、无 unsafe、严格错误处理,盲评 + 全自动判分,以 zlib 为参照跑了 4055 个隐藏测试(真实流、手工构造边界用例、4000 个损坏输入、速度测试和 zip bomb)。
结果:
- Opus 5.5:全部通过,507 MB/s,10分18秒,$2.08
- Sonnet 5.5:全部通过,447 MB/s,3分41秒,$0.52
- GPT-6 Sol:全部通过,301 MB/s,6分37秒,$0.27
- GPT-6 Luna:连正常 zlib 都解不了(一个笔误),$0.007
结论:正确性上 Sonnet 完全追平 Opus,价格仅 1/4、耗时仅 1/3;Opus 的溢价体现在工程质量——用 zlib 式两级 Huffman 表、严格控制输出缓冲上限、还自己写了差分测试器。对定义清晰的任务,Sonnet 5.5 medium 性价比更高;开放性调试任务 Opus 可能仍占优。作者提醒这是单任务单次运行的数据点。
「编程与Agent」频道最新
- Turbopuffer 联创证实 Cursor 弃用服务端 RAG,新模型下 grep 更好用 — ivan_bezdomny · 2026-09-29
- 用户与 Opus 两天协作开发 Skyfall Rush,网页游戏免费可玩 — TAbrodi · 2026-09-29
- Shopify 开放 checkout 给浏览器 AI Agent,可代用户完成购买 — zeeg · 2026-09-29
- Astra 通关 Zork 靠作弊?博主分析:像背攻略而非真探索 — rajammanabrolu · 2026-09-29
- 审计数千次 Agent 回放:80% 在推理中幻想不存在的评分器 — jonas__m · 2026-09-29
- YC 黑客松冠军项目 QM Motion:给编码 Agent 加上时间感知抓 UI 动效 Bug — garrytan · 2026-09-29