Sol与Fable编程评测:专长分化而非全面碾压

7月中旬,围绕两款编程Agent「Sol」与「Fable」(对应GPT-5.6 Sol与Fable 5)的对比讨论集中升温。多位开发者和评测者给出的结论并不是「谁全面碾压谁」,而是两者在编程场景里的优势分布明显不同:解题相关性只有0.48,说明它们擅长的问题并不相同。这也让选型从单纯比胜率,转向比场景、成本与失败方式。

基准结果

Zain Hasan的基准显示,在最佳配置下Sol与Fable都达到88题,但解题相关性仅0.48。Sol的中位执行步数为53步、耗时17分钟,Fable为62步、21分钟,Sol收敛更快。在接近同等表现时,Sol的推理成本也明显更低:约69.2%表现时单次rollout成本约$3.47,而Fable在约69.9%时约$13.41。稳定性方面,他表示在26组早期配置里高可靠性并不容易取得,没有模型超过80%,Sol最高做到84.3%,整体表现更稳一些。

失败模式与开发者体感

按Zain Hasan的拆解,两者失败方式也不同:Sol更容易破坏现有测试,概率约20%,Fable约10%;Fable则更常见遗漏新增测试,比例约65%。开发者实测也呈现分化。RFOK认为Fable 5在多文件压缩包、长链路重构和自动化脚本等大型任务里更稳,而5.6 Sol更像适合演示。bindureddy认为Fable 5在复杂编程任务上明显更强,但5.6 Sol在数据分析和复杂非编程任务上领先。rudrank反馈在自己的C语言任务中Fable 5没达到5.6版Sol的完成度,并称没有5小时的限制反而是一种解放。samgoodwin89则表示两者都已强到不容易「一试就换」,并特别提到5.6 Sol很擅长删减废话和冗余内容。

争议与意义

这组讨论的核心并非单一排行榜变化,而是编程Agent已开始显现「专长分化」。同样是高分模型,在大型重构、复杂编程、数据分析、代码整理等子任务上的表现并不一致。对实际用户而言,下一步更重要的可能不是寻找唯一最强模型,而是根据任务类型在Sol和Fable之间做更细粒度的选择。

2026-07-14 ~ 2026-07-15 · 9 条相关

事件全程(共 2 集)→

一手来源