105 个真实 Bug 实测:Opus 5.5 修 36 个,DeepSeek 花 3 毛修 19 个

PawelHuryn · x · 2026-10-08

Pawel Huryn 用两个真实仓库、105 个前沿模型此前漏掉的植入 Bug 实测各编程模型(Bug Hunt Bench):

核心结论:从 4.5 到 5.5,Haiku 从不支持 effort 等级、基本没用的模型,进化到能胜任真实工程任务的模型;性价比上 DeepSeek 和 GPT-6 Luna 极为突出。

所属事件:Paweł Huryn 自建 Bug Hunt 基准实测多款新编程模型(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →