Kimi K3 Max 单次落后,四次尝试在软件工程上反超 Sol Max
zainhas · x · 2026-07-23
这条深度对比了 Kimi K3 Max 和 Sol Max 在软件工程任务上的表现,核心观点是:模型波动更大,不一定代表整体更差,在允许多次尝试时反而可能获得更高的上限。
图里的关键数据是:
- pass@1:Sol 72.7%,Kimi 68.5%
- pass@2:Kimi 82.0%,Sol 81.0%
- pass@4:Kimi 89.4%,Sol 85.8%
作者的结论是:Kimi 单次命中率略弱,但在多次尝试下的组合表现更强。
所属事件:Kimi K3 Max 与 GPT-5.6 Sol Max 编程能力深度对比(8 条相关)→
「模型」频道最新
- Muse Spark 1.1 生成 3D 街机游戏仅花 $0.026 — rohanpaul_ai · 2026-07-23
- 帖子称特斯拉 Robotaxi 车队已测试早期 FSD v15 — ChrisGPT · 2026-07-23
- OpenAI GPT-5.6 Sol 五天解出 6 个 Erdős 问题 — Charuru · 2026-07-23
- 从业者称 Reddit 限制训练后未来 LLM 可能更强 — AIandDesign · 2026-07-23
- 谷歌确认 Gemini 已接入 Search 的 AI Overviews 和 AI Mode — gaganghotra_ · 2026-07-23
- Reddit 用户称 Grok 更适合长对话,胜过 ChatGPT 和 Claude — Astrum10worlds · 2026-07-23