Kimi K3 评测:开源新王,搜索能力亮眼
andersonbcdefg · x · 2026-07-19
独立评测者将 Kimi K3 加入 prinzbench 基准测试。K3 总分达到 47/99,远超 GLM-5.2 的 30/99,是迄今为止测试过的最佳开源模型。
- 整体对比:得分略低于 2 月份的 Gemini 3.1 Pro(50/99),整体实力可视为同一梯队。K3 在搜索能力上稍强,逻辑推理稍弱。
- 稳定性:K3 表现出明显的波动性,有时会答错较简单的问题,但在高难度问题上常有惊艳表现。
- 核心亮点:搜索子得分达 11/24,成为首个在该基准测试中正确回答 10 个以上搜索问题的非 OpenAI 模型。
「模型」频道最新
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11