实测 105 个 Bug:最贵模型不碰代码,Luna 性价比远超 Fable
PawelHuryn · x · 2026-08-01
开发者 PawelHuryn 分享了基于 105 个隐藏 Bug、9 个前沿模型和 14 轮测试的 AI 编程模型能力路由策略:
- 判断、策略与复杂场景:首选 Fable 5
- 前端开发:Opus 5,其次 Kimi K3
- 写作:Opus 5
- 编码与调试:Luna(最高 effort)、Sol(高 effort)或 Grok 4.5
性价比对比:在修复相同的 Bug 时,Luna(最高 effort)花费 1.80 美元修复了 33 个,而 Fable 5 花费了 104.49 美元仅修复 29 个。作者指出,他最昂贵的模型从不用于直接写代码。
所属事件:开发者开源Bug搜寻基准实测大模型查错能力(2 条相关)→
「编程与Agent」频道最新
- Claude Code 自主奋战 9 小时,从零构建 WebGPU 3D 演示 — heypearlai · 2026-08-01
- Claude Code 作者建议每半年清空配置文件 — FinanceYF5 · 2026-08-01
- 新开源框架解决LLM构建企业级数据管道的幻觉难题 — bendee983 · 2026-08-01
- 测试 Claude Opus 5 做应用:完成度惊人,或已超越 Fable — FinanceYF5 · 2026-08-01
- 开源 Codex-to-Figma 受控工作流 Layntra — Turbulent-Rabbit-613 · 2026-08-01
- 烧光700美元后,AI Agent为罢工编造规则 — kevinnbass · 2026-08-01