Kimi K3 pass@4 达到 89.4%,超过 GPT-5.6 Sol
FinanceYF5 · x · 2026-07-21
一组基准对比显示,Kimi K3 和 Fable 5 在 pass@1 上只差 1 分,但在更高采样预算下 Kimi 开始拉开优势:Kimi 的 pass@2 为 82.0、pass@4 为 89.4;Fable 则分别是 80.2 和 88.5。
图表还指出,Kimi K3 的 89.4% pass@4 已超过该基准中的所有旗舰模型,包括 GPT-5.6 Sol(85.8)。帖主据此认为,在 best-of-k 测试里,K3 已进入开源与闭源模型的最顶层。
所属事件:Kimi K3 软件任务评测紧咬 Fable 5,开源追平闭源(6 条相关)→
「模型」频道最新
- 转发称开源实验室可蒸馏出 32GB 显存级 SOTA 模型 — bookwormengr · 2026-07-21
- Moonshot 因 GPU 需求暴涨暂停 Kimi K3 新注册 — eyishazyer · 2026-07-21
- AI 版《Diplomacy》让智能体谈判结盟又互相背刺 — jamdac · 2026-07-21
- 更强模型需要新的提示方式,旧技巧反而可能拖后腿 — emollick · 2026-07-21
- GLM-5.5 被传 4 周内发布并开放权重 — tanay_mehta · 2026-07-21
- Fable 5 被称找到 Jacobian 猜想的三变量反例 — Various-Affect4841 · 2026-07-21