Kimi K3 多采样评测领先
zephyr_z9 · x · 2026-07-18
图中对比了 **Kimi K3** 和 **Fable 5** 在不同采样次数下的解题表现: - `pass@1`:Kimi K3 为 68.5,略低于 Fable 5 的 69.9。 - `pass@2`:Kimi K3 为 82.0,高于 Fable 5 的 80.2。 - `pass@4`:Kimi K3 为 89.4,高于 Fable 5 的 88.5。 这条转发想表达的是:Kimi K3 在多次采样设置下表现更强,甚至被称为“open/closed SOTA”。
所属事件:Kimi K3 登顶前端代码榜,编程能力逼近 Fable 5(12 条相关)→
「模型」频道最新
- 有人称 OpenAI 和 Anthropic 抱怨中国开源权重模型很荒谬 — krishnan · 2026-07-21
- PrismML Bonsai 27B 量化后仅 3.8GB 可手机运行 — tony10000 · 2026-07-21
- actAVA AI 推出 1T 参数医疗代理模型 Cura — _akhaliq · 2026-07-21
- 有人觉得 Claude Fable 出现了更像 Gemini 的僵硬感 — teortaxesTex · 2026-07-21
- Reddit 实测:z.ai 上的 GLM-5.2 确实能网页搜索 — Umr_at_Tawil · 2026-07-21
- Kimi CEO 称 token 效率才是 Kimi 3 的新优势 — HowDevelop · 2026-07-21