Kimi-K3 的 LisanBench 评测解读
scaling01 · x · 2026-07-18
Kimi-K3 在 LisanBench 上的表现
作者指出,Kimi-K3 是当前 LisanBench 上最强的开权重模型,整体表现优于 Gemini 3.1 Pro (high),但在相近 token 消耗下仍不及 Opus 4.7 xhigh。
关键结论
- 在标准指标上排第 5,在难度加权指标和best-of-3指标上排第 4。
- 也优于 GPT-5.5 和 Opus 4.8,但代价是使用了 2–3 倍 token。
- 作者认为这和他在其他 benchmark 上观察到的趋势一致:Kimi-K3 很强,但还需要一两轮迭代来提升推理效率,才能真正追上前沿模型。
额外观察
- 该模型的搜索行为与其他前沿模型明显不同。
- 它会使用一些非常生僻或过时的词,作者认为这会让标准词典评分对它更不利。
- 更值得注意的是,它会大量利用“wildcard families”:通过在同一位置反复改动一个字母,在一组 edit-distance 为 1 的词簇里连续跳转。
- 作者称,Kimi-K3 约有 35% 的有效转移发生在这类家族中,而其他模型都低于 2%。
所属事件:Kimi-K3登顶LisanBench开源最强模型(2 条相关)→
「模型」频道最新
- 传 OpenAI 在 Astra 中使用 neuralese 循环变换器,新的 scaling 轴浮出水面 — imadade · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- Gemini 3.8 Flash 的 Pareto 最优地位仅维持了 5 小时 18 分钟 — alejandroll10 · 2026-09-03
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Anthropic 商务智能体只建购物车交人工结账,被赞退款风控思路对 — HaktanSuren · 2026-09-03
- Qwen3.8 27B Q8 翻车:12 万 token 后发现根本没读计划,自行实现别的功能 — KingCpzombie · 2026-09-03