Kimi K3 实测接近前沿但难用
PawelHuryn · x · 2026-07-17
作者用同一套 8 个任务,把 Kimi K3 和 Opus 4.8、GPT-5.6、Grok 4.5 放在一起测试。 结果上,K3 在已完成的 7 个任务里有 6 个表现持平或更好,抓到 21 个植入 bug 中的 14 个,超过 Opus 的 12 个;同时它也误报了 2 个 bug,是唯一出现这种情况的模型。 但问题也很明显: - 刚发布时有 2 个任务直接返回 0 token - 13 小时后重跑,其中一个变成满分,另一个仍无法通过 - OpenRouter 仍在限流,Moonshot 自家 API 也提示 engine overloaded 作者的结论是:K3 的权重虽然开放,但当前可用推理容量还跟不上。
所属事件:Kimi K3编码实测接近前沿但体验欠佳(3 条相关)→
「模型」频道最新
- 中国模型在 OpenRouter 上领先 — JOBhakdi · 2026-07-20
- AI解RH会被区别对待的段子 — tak3sh8 · 2026-07-20
- 泄露称 GLM-5.5 可能8月发布 — teortaxesTex · 2026-07-20
- Gemini 出现奇怪崩坏 — windowssandbox · 2026-07-20
- Hermes 发布桌面与路由大更新 — Teknium · 2026-07-20
- 100万上下文未必更实用 — mattpocockuk · 2026-07-20