105 个隐藏 bug 实测:Fable 5.1 找出 43 个,无一模型全中
PawelHuryn · x · 2026-09-03
PawelHuryn 在 Antigravity CLI 上用 2 个真实仓库、105 个隐藏 bug 对多个模型做了 agent 找 bug 实测:
- Fable 5.1 (max):43/105,花费 $77.55
- GPT-5.6 (max):42/105,花费 $69.61
- Grok 4.6 (xhigh):27/105,花费 $16.96
- Opus 5 (max):21/105,花费 $51.33
- Gemini 3.8 Flash (high):20/105,花费 $9.78
Gemini 3.8 Flash 较 3.6 Flash(16/20 水位)有明显提升,虽非最强但性价比突出。他强调这些不是随机 bug,而是 2026 年初 agent 仍会漏掉的难题;“未植入”类问题不计入——部分模型常报告并修复真实但不相关的 issue。
43 个 bug 至今没有任何模型修复。实用建议:用另一个模型家族来验证工作成果,因为同家族模型共享同样的盲点。
所属事件:105 个隐藏 bug 实测各模型找错能力(2 条相关)→
「编程与Agent」频道最新
- 开发者发问:现在还该用 LangChain 还是自建 agent 框架? — curious_vii · 2026-09-03
- 推理工程吃香:vLLM/SGLang 搭副本加缓存路由核心配方 — GabGarrett · 2026-09-03
- 开发者误打误撞用 Fable 5.1 搭出一座「智能体工厂」 — 0xkarasy · 2026-09-03
- 微软新法:Foundry 智能体可经 Fabric IQ 调用 Fabric 数据智能体 — adnan_hashmi · 2026-09-03
- Databricks 在 VLDB 2026 主推 agent 原生数据基础设施 Lakebase — matei_zaharia · 2026-09-03
- doodlestein 沉淀数月经验,发布 Web 应用综合审查 Skill — doodlestein · 2026-09-03