Kimi K3 榜单很强,真实工程测试却暴露可靠性差距
Cole Medin · youtube · 2026-07-24
这支 YouTube 视频把 Kimi K3 拿来和 Opus 4.8、Kimi K2.7 做真实工程任务测试,结论是:公开 benchmark 里的高分,未必等于实际开发中的稳定表现。
视频里的主要观点包括:
- Kimi K3 在 benchmark 上看起来非常强,甚至像是接近或超过顶级闭源模型。
- 但在真实工程任务中,它仍有一些可靠性失败模式,而这类问题往往不会被公开榜单完整捕捉。
- 在简单任务上,K3 大致可以和 Opus 打平;但任务复杂后,Opus 会拉开差距。
- 作者认为开源权重模型仍然很有价值,适合作为混合模型工作流里的“主力干活机”。
- 视频附带了开源的 benchmark 仓库、评分 rubric、提示词和 harness,方便别人复现。
视频中还提到一个很醒目的结果:失败率 8% 对 36%,作者用它说明基准设计比榜单标题更重要。
「模型」频道最新
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11