Kimi K3 更像差一点,GPT-5.6 Sol 更容易破坏基线
zainhas · x · 2026-07-23
Kimi K3 和 Sol 的失败方式不同
这条图表把同一基准下的失败类型拆开看:
- Kimi K3 更接近答案,但经常只是差一点没过全部测试。
- GPT-5.6 Sol 更容易把已有基线测试打坏。
图里的分布是:
- Kimi K3:65% 近失误、11% 局部失败、13% 大失败、11% 破坏基线
- Sol:54% 近失误、15% 局部失败、11% 大失败、20% 破坏基线
作者还说,Sol 这种 20% 的基线破坏模式和其他 GPT 模型很一致;而 Kimi 的失败画像更像 Claude 风格的回归。
「模型」频道最新
- Bindu Reddy 称 OpenAI 和 Anthropic 可用更快迭代压过 Kimi — bindureddy · 2026-07-23
- Reddit 用户称 Gemini 长音频转写中 5 次编造内容 — MarketNational3237 · 2026-07-23
- Radeon AI PRO R9700 跑 Gemma 4-26B 仅 20 tok/s — veryhasselglad · 2026-07-23
- Greg Brockman 赞 Kimi K3 不错,但蒸馏仍未查明 — Polymarket · 2026-07-23
- 一条帖建议:模型命名不如直接统一叫 open models — cocktailpeanut · 2026-07-23
- 按语言拆分的代码表现,暗示一个简单路由器 — zainhas · 2026-07-23