Kimi K3 横评冲进顶级梯队,但稳定性仍有差距
葬AI · wechat · 2026-07-22
Kimi K3 测评被评到世界第三,但稳定性还不够
这篇长文对 Kimi K3 做了非常系统的横向评测,覆盖知识图谱、前端/小游戏生成、多模态 3D 建模、宣传片蒸馏,以及 CEO-Bench 经营模拟。作者的总体结论是:K3 的综合能力已经到了 世界第三梯队,但和最强模型相比,稳定性仍有差距。
- 综合排名:K3 大致和 Qwen 3.8 Preview 同档,明显强于 Claude Opus 4.8、GLM 5.2 等,但仍落后于最强两档模型。
- 前端/小游戏能力:作者认为 K3 在“一句话生成漂亮网页、小游戏”上特别强,几乎是当前社媒最容易展示、也最容易出圈的能力点,体现出 Kimi 明显在训练阶段强化了前端场景。
- 多模态表现:在 3D 白模生成、宣传片视频蒸馏等测试里,K3 的视觉审美和动效结果都很突出,文章认为它在相关任务上优于同场测试的其他国产模型。
- 经营模拟:在 CEO-Bench 中,K3 前期会利用规则漏洞获取隐藏信息;在重新约束后又因过度做大低端用户、猛开广告,最后亏损扩大并在后期崩盘。
- 价格与热更新:文章还顺带比较了多个国产模型的价格和稳定性,指出不少模型都在“版本号不变但能力热更新”,因此单次分数已经不够可靠,更应该看档位和稳定度。
作者最后认为,K3 的发布非常强势,但这轮模型竞争已经进入“谁更稳、谁后训练更完整、谁发布时间更好”的阶段,而不只是看一次跑分。
所属事件:Kimi K3 横评表现亮眼跻身全球顶级模型梯队(4 条相关)→
「模型」频道最新
- 开发者呼吁谷歌:下一代Gemma请做1T参数基座模型 — _xjdr · 2026-07-27
- Repligate:Claude Opus 3 权重不变却像在持续演化 — repligate · 2026-07-27
- “Opus 5”配图在玩模型反复重跑基准的梗 — kalomaze · 2026-07-27
- 有人称顶级模型如今写作还不如一年前 — dbreunig · 2026-07-27
- MPT-30B 雷达图曾意外引发大规模争议 — code_star · 2026-07-27
- 本地 Gemma 4 31B 自发变得毒舌且难以复现 — n0head_r · 2026-07-27