Kimi K3 Max 对比 GPT-5.6 Sol Max:编程能力互补的路由问题
7月23日,zainhas 发布多篇深度分析,全面对比了 Kimi K3 Max 与 GPT-5.6 Sol Max 在软件工程及编程任务上的表现。核心结论是:这两款模型并非简单的整体优劣关系,而是在不同子领域、失败模式及性价比上各有专长,适合在实际应用中通过路由策略组合使用。
已确认
在 8 类编程任务的基准测试中,GPT-5.6 Sol 在其中 5 个领域保持领先,且单次可靠性达到创纪录的 84.5%。但在允许模型进行多次尝试(如 pass@k)的情况下,Kimi K3 Max 虽然单次通过率(pass@1)落后,但由于其波动性带来了更高的性能上限,峰值通过率达到 89.4%,最终在软件工程任务上反超 Sol Max。从推理经济账来看,Kimi K3 Max 每次 rollout 成本为 4.65 美元,虽然速度比 Sol Max(8.37 美元)慢,但大致能以相当于 Sol Max 55% 的价格实现非常接近的效果。
失败模式与路由策略
除了跑分数据,zainhas 还拆解了两者的失败类型。Kimi K3 的表现通常更接近正确答案,但经常差一点未能通过全部测试;相比之下,GPT-5.6 Sol 在失败时更容易破坏已有的基线测试。基准数据显示,Kimi K3 和 Sol 4.6 在任务上的相关性仅为 0.46,说明它们成功和失败的方式截然不同。基于这种高度互补性而非能力重叠,zainhas 认为这本质上是一个“路由问题”。通过先用 Kimi K3,仅在 verifier 判定失败时升级到 Sol 的级联策略,解题率可提升至 85.6%(单题成本约 7.30 美元),而理论上通过路由或级联组合两者可覆盖 95.6% 的任务。
2026-07-23 ~ 2026-07-24 · 10 条相关
一手来源
- Kimi K3 max 对比 GPT-5.6 Sol max:更像路由问题 — zainhas ·
- Kimi K3 Max 单次落后,四次尝试在软件工程上反超 Sol Max — zainhas ·
- Kimi K3 和 Sol 4.6 相关性低,合用覆盖 95.6% — zainhas ·
- 【源头】Kimi K3 max 对比 GPT-5.6 Sol max:更像路由问题 — zainhas · 2026-07-23
- 【源头】Kimi K3 Max 单次落后,四次尝试在软件工程上反超 Sol Max — zainhas · 2026-07-23
- Kimi K3 每次 rollout 只要 4.65 美元,但比 Sol 慢得多 — zainhas · 2026-07-23
- Sol 可靠性 84.5%,Kimi 峰值通过率 89.4% — zainhas · 2026-07-23
- 【源头】Kimi K3 和 Sol 4.6 相关性低,合用覆盖 95.6% — zainhas · 2026-07-23
- Kimi K3 与 GPT-5.6 Sol 在 8 类编程任务中各赢一半 — zainhas · 2026-07-23
- Kimi K3 更像差一点,GPT-5.6 Sol 更容易破坏基线 — zainhas · 2026-07-23
- Kimi K3 Max 以 55% 价格接近 GPT 5.6 Sol Max — zainhas · 2026-07-23
- Kimi K3 级联 Sol 解题率升至 85.6%,单题 $7.30 — zainhas · 2026-07-23
- Kimi K3 Max 在软件任务上接近 GPT 5.6,价格仅 55% — togethercompute · 2026-07-24