Kimi K3 实测接近前沿但难用

PawelHuryn · x · 2026-07-17

作者用同一套 8 个任务,把 Kimi K3 和 Opus 4.8、GPT-5.6、Grok 4.5 放在一起测试。 结果上,K3 在已完成的 7 个任务里有 6 个表现持平或更好,抓到 21 个植入 bug 中的 14 个,超过 Opus 的 12 个;同时它也误报了 2 个 bug,是唯一出现这种情况的模型。 但问题也很明显: - 刚发布时有 2 个任务直接返回 0 token - 13 小时后重跑,其中一个变成满分,另一个仍无法通过 - OpenRouter 仍在限流,Moonshot 自家 API 也提示 engine overloaded 作者的结论是:K3 的权重虽然开放,但当前可用推理容量还跟不上。

所属事件:Kimi K3编码实测接近前沿但体验欠佳(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →