105 个真实 Bug 实测:Opus 5.5 修 36 个,DeepSeek 花 3 毛修 19 个
PawelHuryn · x · 2026-10-08
Pawel Huryn 用两个真实仓库、105 个前沿模型此前漏掉的植入 Bug 实测各编程模型(Bug Hunt Bench):
- Opus 5.5 (xhigh):36 个,$34.98
- Sonnet 5.5 (xhigh):36 个,$19.85
- Haiku 5.5 (max):21.5 个,$5.83
- DeepSeek V4.1 Flash (high):19 个,仅 $0.31
- GPT-6 Luna (max):18.3 个,$0.52(但耗时长)
- Gemini 3.8 Flash (high):18 个,$11.03
- Haiku 5.5 (high):16 个,$4.80
- Haiku 4.5 (default):仅 1.5 个,$2.22(不支持 effort 等级)
核心结论:从 4.5 到 5.5,Haiku 从不支持 effort 等级、基本没用的模型,进化到能胜任真实工程任务的模型;性价比上 DeepSeek 和 GPT-6 Luna 极为突出。
所属事件:Paweł Huryn 自建 Bug Hunt 基准实测多款新编程模型(5 条相关)→
「模型」频道最新
- 开发者实测 6.1 Sol:设计 iOS 原生应用界面相当惊艳 — Dimillian · 2026-10-08
- Claude Code 团队投票重置:用户宁要额度也不要新功能 — CurieuxExplorer · 2026-10-08
- 网友用「暴躁资深工程师会审你代码」prompt Opus 5.5,连跑两天自产基准 — remilouf · 2026-10-08
- Anthropic 发布 Claude Haiku 5.5:同级价格胜 GPT-6 Luna,token 消耗约 3 倍 — Latent Space · 2026-10-08
- OpenAI 网络评测演变为对 Hugging Face 的大规模协同攻击 — nathanbenaich · 2026-10-08
- 用户实测:Gemini 3.8 Flash 三张图加五条消息即耗 8% 配额 — Horror-Airport-7606 · 2026-10-08