Sol与Fable编程评测:专长分化而非全面碾压
7月中旬,围绕两款编程Agent「Sol」与「Fable」(对应GPT-5.6 Sol与Fable 5)的对比讨论集中升温。多位开发者和评测者给出的结论并不是「谁全面碾压谁」,而是两者在编程场景里的优势分布明显不同:解题相关性只有0.48,说明它们擅长的问题并不相同。这也让选型从单纯比胜率,转向比场景、成本与失败方式。
基准结果
Zain Hasan的基准显示,在最佳配置下Sol与Fable都达到88题,但解题相关性仅0.48。Sol的中位执行步数为53步、耗时17分钟,Fable为62步、21分钟,Sol收敛更快。在接近同等表现时,Sol的推理成本也明显更低:约69.2%表现时单次rollout成本约$3.47,而Fable在约69.9%时约$13.41。稳定性方面,他表示在26组早期配置里高可靠性并不容易取得,没有模型超过80%,Sol最高做到84.3%,整体表现更稳一些。
失败模式与开发者体感
按Zain Hasan的拆解,两者失败方式也不同:Sol更容易破坏现有测试,概率约20%,Fable约10%;Fable则更常见遗漏新增测试,比例约65%。开发者实测也呈现分化。RFOK认为Fable 5在多文件压缩包、长链路重构和自动化脚本等大型任务里更稳,而5.6 Sol更像适合演示。bindureddy认为Fable 5在复杂编程任务上明显更强,但5.6 Sol在数据分析和复杂非编程任务上领先。rudrank反馈在自己的C语言任务中Fable 5没达到5.6版Sol的完成度,并称没有5小时的限制反而是一种解放。samgoodwin89则表示两者都已强到不容易「一试就换」,并特别提到5.6 Sol很擅长删减废话和冗余内容。
争议与意义
这组讨论的核心并非单一排行榜变化,而是编程Agent已开始显现「专长分化」。同样是高分模型,在大型重构、复杂编程、数据分析、代码整理等子任务上的表现并不一致。对实际用户而言,下一步更重要的可能不是寻找唯一最强模型,而是根据任务类型在Sol和Fable之间做更细粒度的选择。
2026-07-14 ~ 2026-07-15 · 9 条相关
- 第 1 集:GPT-5.6 Sol与Fable 5实测:智力与实用性的博弈(2026-07-10,18 条)
- 第 2 集:Sol与Fable编程评测:专长分化而非全面碾压(2026-07-14,9 条)
一手来源
- Sol 与 Fable 的编程评测差异 — ZainHasan6 ·
- AI编程Agent Sol与Fable性能对比 — ZainHasan6 ·
- Fable 5 与 5.6 sol 的能力对比 — bindureddy · 2026-07-14
- 大规模重构实测:Fable 5更稳 — RFOK · 2026-07-14
- 两个模型都好到难选 — samgoodwin89 · 2026-07-14
- Sol与Fable推理成本对比 — ZainHasan6 · 2026-07-15
- Sol 更稳,Fable 更贵 — ZainHasan6 · 2026-07-15
- 【源头】Sol 与 Fable 的编程评测差异 — ZainHasan6 · 2026-07-15
- Sol与Fable智能体表现差异对比 — ZainHasan6 · 2026-07-15
- 【源头】AI编程Agent Sol与Fable性能对比 — ZainHasan6 · 2026-07-15
- 开发者实测:Fable 5不及5.6版Sol的C语言表现 — rudrank · 2026-07-15