自建盲测:Sonnet 5.5 正确率追平 Opus 5.5,价格仅四分之一

_Duex · reddit · 2026-09-29

作者用同一个自包含任务横向实测新发布的 Sonnet 5.5 与 Opus 5.5(另加 GPT-6 Sol/Luna 对照):从零写一个 Rust 版 DEFLATE/zlib 解压器,无依赖、无 unsafe、严格错误处理,盲评 + 全自动判分,以 zlib 为参照跑了 4055 个隐藏测试(真实流、手工构造边界用例、4000 个损坏输入、速度测试和 zip bomb)。

结果:

结论:正确性上 Sonnet 完全追平 Opus,价格仅 1/4、耗时仅 1/3;Opus 的溢价体现在工程质量——用 zlib 式两级 Huffman 表、严格控制输出缓冲上限、还自己写了差分测试器。对定义清晰的任务,Sonnet 5.5 medium 性价比更高;开放性调试任务 Opus 可能仍占优。作者提醒这是单任务单次运行的数据点。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →