Sol 可靠性 84.5%,Kimi 峰值通过率 89.4%
zainhas · x · 2026-07-23
这条帖子用图表对比了 Sol 和 Kimi 在同一基准上的表现,重点不是单次峰值,而是“稳定性 vs 上限”的差别。
- Sol:可靠性达到 84.5%,创下记录;有 61 个任务做到 4/4,但覆盖率峰值只有 85.8%。
- Kimi:峰值 pass@4 通过率更高,达到 89.4%;但可靠性只有 76.6%。
- 图里把两者放在“平面的对角”上:一个更稳,一个更容易冲高。
所属事件:Kimi K3 Max 对比 GPT-5.6 Sol Max:编程能力互补的路由问题(10 条相关)→
「模型」频道最新
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- Anthropic 调整年龄验证,Claude 不再向未成年人开放 — Muhammad523 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11