Kimi K3 pass@4 达到 89.4%,超过 GPT-5.6 Sol
FinanceYF5 · x · 2026-07-21
一组基准对比显示,Kimi K3 和 Fable 5 在 pass@1 上只差 1 分,但在更高采样预算下 Kimi 开始拉开优势:Kimi 的 pass@2 为 82.0、pass@4 为 89.4;Fable 则分别是 80.2 和 88.5。
图表还指出,Kimi K3 的 89.4% pass@4 已超过该基准中的所有旗舰模型,包括 GPT-5.6 Sol(85.8)。帖主据此认为,在 best-of-k 测试里,K3 已进入开源与闭源模型的最顶层。
所属事件:Kimi K3比肩Fable 5:性能相当且成本仅三分之一(7 条相关)→
「模型」频道最新
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11