实测 105 个 Bug:最贵模型不碰代码,Luna 性价比远超 Fable

PawelHuryn · x · 2026-08-01

开发者 PawelHuryn 分享了基于 105 个隐藏 Bug、9 个前沿模型和 14 轮测试的 AI 编程模型能力路由策略:

性价比对比:在修复相同的 Bug 时,Luna(最高 effort)花费 1.80 美元修复了 33 个,而 Fable 5 花费了 104.49 美元仅修复 29 个。作者指出,他最昂贵的模型从不用于直接写代码。

所属事件:开发者开源Bug搜寻基准实测大模型查错能力(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →