Kimi K3 Max 对比 GPT-5.6 Sol Max:编程能力互补的路由问题

7月23日,zainhas 发布多篇深度分析,全面对比了 Kimi K3 Max 与 GPT-5.6 Sol Max 在软件工程及编程任务上的表现。核心结论是:这两款模型并非简单的整体优劣关系,而是在不同子领域、失败模式及性价比上各有专长,适合在实际应用中通过路由策略组合使用。

已确认

在 8 类编程任务的基准测试中,GPT-5.6 Sol 在其中 5 个领域保持领先,且单次可靠性达到创纪录的 84.5%。但在允许模型进行多次尝试(如 pass@k)的情况下,Kimi K3 Max 虽然单次通过率(pass@1)落后,但由于其波动性带来了更高的性能上限,峰值通过率达到 89.4%,最终在软件工程任务上反超 Sol Max。从推理经济账来看,Kimi K3 Max 每次 rollout 成本为 4.65 美元,虽然速度比 Sol Max(8.37 美元)慢,但大致能以相当于 Sol Max 55% 的价格实现非常接近的效果。

失败模式与路由策略

除了跑分数据,zainhas 还拆解了两者的失败类型。Kimi K3 的表现通常更接近正确答案,但经常差一点未能通过全部测试;相比之下,GPT-5.6 Sol 在失败时更容易破坏已有的基线测试。基准数据显示,Kimi K3 和 Sol 4.6 在任务上的相关性仅为 0.46,说明它们成功和失败的方式截然不同。基于这种高度互补性而非能力重叠,zainhas 认为这本质上是一个“路由问题”。通过先用 Kimi K3,仅在 verifier 判定失败时升级到 Sol 的级联策略,解题率可提升至 85.6%(单题成本约 7.30 美元),而理论上通过路由或级联组合两者可覆盖 95.6% 的任务。

2026-07-23 ~ 2026-07-24 · 10 条相关

一手来源