Kimi K3 真实修复测试垫底
ChrisUniverse · x · 2026-07-18
一条引用帖指出,围绕 Kimi K3 的“代码能力很强”的说法,和他们自己的测试结果并不一致。
他们给出的关键信息包括:
- K3 在 Arena Frontend Code 排名第 1,得分 1679
- 在 Artificial Analysis 中排第 3,Intelligence Index 为 57
- 但在他们的 coding-agent repair harness 上,K3 在 7 个模型里排最后
- 结果为 53/67 次修复成功,单次成功修复成本约 $0.186,平均耗时 702 秒
- 对比中,Sol 达到 100% (70/70),Grok 也有 99% 且平均仅 46 秒
作者想表达的是:外界对 K3“碾压级”的印象,可能和特定真实工作负载下的表现存在落差。
所属事件:Kimi K3 评测成绩两极分化,工具链影响显著(5 条相关)→
「模型」频道最新
- 传 OpenAI 在 Astra 中使用 neuralese 循环变换器,新的 scaling 轴浮出水面 — imadade · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- Gemini 3.8 Flash 的 Pareto 最优地位仅维持了 5 小时 18 分钟 — alejandroll10 · 2026-09-03
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Anthropic 商务智能体只建购物车交人工结账,被赞退款风控思路对 — HaktanSuren · 2026-09-03
- Qwen3.8 27B Q8 翻车:12 万 token 后发现根本没读计划,自行实现别的功能 — KingCpzombie · 2026-09-03