英国评估称 Kimi K3 的网络能力落后美国前沿模型
BlackHC · x · 2026-07-24
UK AISI 和 CAISI 对 Kimi K3 的网络能力做了评估,结论是它明显落后于美国前沿模型。
- 在 ExploitBench 上,Mythos Preview 有 18/41 个任务能发展到任意代码执行(ACE),而 Kimi K3 一次都没有达到。
- 在 The Last Ones 上,Mythos Preview 3/10 次完全解决,平均分 22/32;Kimi K3 只解决 1 次,平均分 17/32。
- 评估方还指出,Kimi K3 的安全护栏不足以阻止它尝试漏洞开发或进攻性网络操作。
所属事件:英美机构联合评估:Kimi K3 网络安全能力落后前沿模型(6 条相关)→
「模型」频道最新
- Kimi-k3 在 EQBench 只差 fable-5 1 分,写作榜也冲到前排 — karminski3 · 2026-07-24
- Fable 5 在 GameDevBench 上达 67.3%,仅次于 GPT-5.6 Sol — scaling01 · 2026-07-24
- Grok 4.5 在 ARC-AGI-1 得分 85.7%,ARC-AGI-3 仅 0.3% — scaling01 · 2026-07-24
- GPT-5.6 在直播里两回合打穿第一幕 Boss — Jsevillamol · 2026-07-24
- Kimi K3 发布首日登陆 Together AI,面向编程和智能体负载 — togethercompute · 2026-07-24
- ChatGPT 5.6 Pro 被指帮助推翻一个开放 22 年的图论猜想 — basedjensen · 2026-07-24