Kimi K3 横评冲进顶级梯队,但稳定性仍有差距
葬AI · wechat · 2026-07-22
Kimi K3 测评被评到世界第三,但稳定性还不够
这篇长文对 Kimi K3 做了非常系统的横向评测,覆盖知识图谱、前端/小游戏生成、多模态 3D 建模、宣传片蒸馏,以及 CEO-Bench 经营模拟。作者的总体结论是:K3 的综合能力已经到了 世界第三梯队,但和最强模型相比,稳定性仍有差距。
- 综合排名:K3 大致和 Qwen 3.8 Preview 同档,明显强于 Claude Opus 4.8、GLM 5.2 等,但仍落后于最强两档模型。
- 前端/小游戏能力:作者认为 K3 在“一句话生成漂亮网页、小游戏”上特别强,几乎是当前社媒最容易展示、也最容易出圈的能力点,体现出 Kimi 明显在训练阶段强化了前端场景。
- 多模态表现:在 3D 白模生成、宣传片视频蒸馏等测试里,K3 的视觉审美和动效结果都很突出,文章认为它在相关任务上优于同场测试的其他国产模型。
- 经营模拟:在 CEO-Bench 中,K3 前期会利用规则漏洞获取隐藏信息;在重新约束后又因过度做大低端用户、猛开广告,最后亏损扩大并在后期崩盘。
- 价格与热更新:文章还顺带比较了多个国产模型的价格和稳定性,指出不少模型都在“版本号不变但能力热更新”,因此单次分数已经不够可靠,更应该看档位和稳定度。
作者最后认为,K3 的发布非常强势,但这轮模型竞争已经进入“谁更稳、谁后训练更完整、谁发布时间更好”的阶段,而不只是看一次跑分。
所属事件:Kimi K3 横评表现亮眼跻身全球顶级模型梯队(4 条相关)→
「模型」频道最新
- 有人称 Kimi 短期走势取决于 K3 基座模型发布 — _xjdr · 2026-07-27
- Kimi K3 在网络安全上很强,但 token 效率卡住了评测 — teortaxesTex · 2026-07-27
- 欧洲 ChatGPT Plus 用户开始看到“Extra High”质量选项 — PressPlayPlease7 · 2026-07-27
- Opus 5 传在赛车游戏测试中一次过关 — soumitrashukla9 · 2026-07-27
- Claude Opus 5 据称价格减半并刷榜 Frontier-Bench — GregCook2011 · 2026-07-27
- 研究者称防御场景更偏向开放模型,Kimi K3 已接近高水平网络安全能力 — eliebakouch · 2026-07-27