Kimi K3 实测接近前沿但难用

PawelHuryn · x · 2026-07-17

作者用同一套 8 个任务,把 Kimi K3 和 Opus 4.8、GPT-5.6、Grok 4.5 放在一起测试。

结果上,K3 在已完成的 7 个任务里有 6 个表现持平或更好,抓到 21 个植入 bug 中的 14 个,超过 Opus 的 12 个;同时它也误报了 2 个 bug,是唯一出现这种情况的模型。

但问题也很明显:

作者的结论是:K3 的权重虽然开放,但当前可用推理容量还跟不上。

所属事件:Kimi K3编码实测接近前沿但体验欠佳(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →