Sol 与 Fable 的编程评测差异
ZainHasan6 · x · 2026-07-15
这条在比较两个编程/agent 配置 Sol 和 Fable 的能力差异,核心结论是:它们“解决的问题不一样”,相关性只有 0.48。
主要结果
- 两者在最佳配置下都能解出 88 个任务
- 仅 Sol 能解:9 个任务
- 仅 Fable 能解:12 个任务
- 两者都解不了:4 个任务
失败模式不同
- Sol 失败时,有 20% 的概率会破坏仓库里原有的测试
- Fable 失败时,更常见的是“差一点过关”,约 65% 属于漏掉最后一个新测试
稳定性与上限
- 在之前 26 组配置里,没有任何模型超过 80% reliability(即同一任务 4/4 次都能通过的比例)
- Sol 的最高 reliability 是 84.3%,有 61 个任务能做到 4/4 全过
- Fable 的峰值更高,为 88%,高于 Sol 的 85.8%
- 但 Sol 被描述为“更可靠的工具”,Fable 更容易出现偶发但惊艳的结果
所属事件:Sol与Fable编程评测:专长分化而非全面碾压(9 条相关)→
「编程与Agent」频道最新
- Fable 5.1 生成 three.js 网站实测:快且精准,但细节仍需人把关 — repligate · 2026-09-03
- SentinelX 开源:让 LLM 安全接管你的 Linux 服务器终端 — CarolusX74 · 2026-09-03
- 连载 30 天:用 fable 5.1 给户外机器人写出无线手柄控制器 — _Stocko_ · 2026-09-03
- 试水 AmpCode:可用 ChatGPT 订阅、每线程一台云电脑,槽点是吉祥物 Puck — carlosdponx · 2026-09-03
- 一人一 Agent 独立 microVM:语言学习产品上线生产环境的三个教训 — maritime_sh · 2026-09-03
- 断网手写 10 页文档后让 Agent 做成 PPT:作者发现自己文字像 AI 糊弄产物 — cnakazawa · 2026-09-03