Kimi K3 Max 单次落后,四次尝试在软件工程上反超 Sol Max

zainhas · x · 2026-07-23

这条深度对比了 Kimi K3 Max 和 Sol Max 在软件工程任务上的表现,核心观点是:模型波动更大,不一定代表整体更差,在允许多次尝试时反而可能获得更高的上限。

图里的关键数据是:

作者的结论是:Kimi 单次命中率略弱,但在多次尝试下的组合表现更强。

所属事件:Kimi K3 Max 与 GPT-5.6 Sol Max 编程能力深度对比(8 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →