Kimi K3 在 ExploitBench 仅得 32%,远落后美国前沿模型
The Decoder · rss · 2026-07-24
The Decoder 引述英国 AI Security Institute 和美国 AI Standards and Innovation Center 的测试称,Moonshot AI 的 Kimi K3 在进攻性网络安全任务上明显落后于美国前沿模型。
关键信息:
- Kimi K3 在 ExploitBench 上得分 32%
- 领先美国模型得分约 76%
- 其安全护栏未能稳定阻止漏洞利用开发或模拟攻击
文章还指出,Kimi K3 在通用基准上表现不错,但在 cyber 能力上掉队,这与外界关于 Moonshot 可能蒸馏 Anthropic 模型的指控形成了呼应。
「模型」频道最新
- 有人认为模型仍像玩具,但已经非常接近可用 — MoonL88537 · 2026-07-24
- BTL-3 登上 Hugging Face 热门,主打编码与工具调用 — badtheorylabs · 2026-07-24
- 腾讯合并混元多模态与大模型团队 — jiqizhixin · 2026-07-24
- Kimi 美国新号已能付费升级,欧盟账号仍在等候名单 — evilsocket · 2026-07-24
- Laguna S 2.1 被指变笨,争论是否是量化精度惹祸 — burritoresearch · 2026-07-24
- antirez 称 Opus 5 将决定 Anthropic 成败 — antirez · 2026-07-24