Kimi K3编程实测接近前沿
PawelHuryn · x · 2026-07-17
作者用同一套 8 任务编码测试,把 Kimi K3 和 Opus 4.8、GPT-5.6、Grok 4.5 放在一起比较。
测试结果
- K3 在完成的 7 个任务里,有 6 个表现打平或超过另外三款模型。
- 它抓出了 21 个植入 bug 中的 14 个,高于 Opus 的 12 个,其他模型都没有超过 7 个。
- 但它也报了 2 个误报,是唯一出现误报的模型。
关键问题
- 上线当晚,有 2 个任务直接返回 0 tokens,不是答错,而是没有输出。
- 13 小时后重跑,其中 1 个任务变成 14/14 满分,说明同模型在不同时间可用性差异很大。
- 截至发帖时,OpenRouter 仍在限流,Moonshot 自家 API 也提示 engine overloaded。
结论
- 这是一个 2.8 万亿参数、号称史上最大的开源权重模型。
- 但作者的判断很直接:权重是开放的,容量不是。 现在不仅普通用户跑不动,Moonshot 自己也还没有稳定承载。
所属事件:Kimi K3编码实测接近前沿但体验欠佳(3 条相关)→
「编程与Agent」频道最新
- Fable 5.1 生成 three.js 网站实测:快且精准,但细节仍需人把关 — repligate · 2026-09-03
- SentinelX 开源:让 LLM 安全接管你的 Linux 服务器终端 — CarolusX74 · 2026-09-03
- 连载 30 天:用 fable 5.1 给户外机器人写出无线手柄控制器 — _Stocko_ · 2026-09-03
- 试水 AmpCode:可用 ChatGPT 订阅、每线程一台云电脑,槽点是吉祥物 Puck — carlosdponx · 2026-09-03
- 一人一 Agent 独立 microVM:语言学习产品上线生产环境的三个教训 — maritime_sh · 2026-09-03
- 断网手写 10 页文档后让 Agent 做成 PPT:作者发现自己文字像 AI 糊弄产物 — cnakazawa · 2026-09-03