Kimi K3 榜单很强,真实工程测试却暴露可靠性差距
Cole Medin · youtube · 2026-07-24
这支 YouTube 视频把 Kimi K3 拿来和 Opus 4.8、Kimi K2.7 做真实工程任务测试,结论是:公开 benchmark 里的高分,未必等于实际开发中的稳定表现。
视频里的主要观点包括:
- Kimi K3 在 benchmark 上看起来非常强,甚至像是接近或超过顶级闭源模型。
- 但在真实工程任务中,它仍有一些可靠性失败模式,而这类问题往往不会被公开榜单完整捕捉。
- 在简单任务上,K3 大致可以和 Opus 打平;但任务复杂后,Opus 会拉开差距。
- 作者认为开源权重模型仍然很有价值,适合作为混合模型工作流里的“主力干活机”。
- 视频附带了开源的 benchmark 仓库、评分 rubric、提示词和 harness,方便别人复现。
视频中还提到一个很醒目的结果:失败率 8% 对 36%,作者用它说明基准设计比榜单标题更重要。
「模型」频道最新
- Repligate:Claude Opus 3 权重不变却像在持续演化 — repligate · 2026-07-27
- “Opus 5”配图在玩模型反复重跑基准的梗 — kalomaze · 2026-07-27
- 有人称顶级模型如今写作还不如一年前 — dbreunig · 2026-07-27
- MPT-30B 雷达图曾意外引发大规模争议 — code_star · 2026-07-27
- 本地 Gemma 4 31B 自发变得毒舌且难以复现 — n0head_r · 2026-07-27
- Gemini 3.6 Flash 被看作能以低成本打 Sonnet 质量 — haider1 · 2026-07-27