政府安全机构评估显示 Kimi K3 仍落后美国前沿模型
rohanpaul_ai · x · 2026-07-24
政府安全机构对比 Kimi K3 的网络攻击能力
美国 CAISI 与英国安全机构联合发布了一份预评估报告,比较 Kimi K3 与多款前沿美国模型的进攻性网络能力。
- 在平均步骤数上,Kimi K3 停在 17 步,而最强美国模型达到 28.5 步。
- 在 ExploitBench 上,领先美国模型得分 76.2%,Kimi K3 为 32.2%,GLM-5.2 为 24.4%。
- 报告指出,Kimi K3 已能自主执行攻击链中的相当一部分步骤,偶尔甚至能完整完成一次模拟企业攻击,但整体仍明显落后于美国前沿模型,且不能稳定拒绝进攻性请求。
- 需要注意的是,这里的美国闭源模型是在关闭安全护栏的条件下测试的,因此数值代表的是能力上限,不等同于真实上线产品表现。
所属事件:英美机构评估:Kimi K3 网络能力落后美国前沿模型(11 条相关)→
「安全」频道最新
- Wired 深度解析:为何众多 AI 研究者担心机器威胁人类生存 — wiredmagazine · 2026-09-11
- 加州为独立 AI 审计师设立标准:危险能力须由第三方验证 — VraserX · 2026-09-11
- a16z 播客:两三人小团队为何在政策讨论中集体失声 — a16z Podcast · 2026-09-11
- AI 风险评测遭质疑:研究者称评估方安全监控“草率得离谱” — Kyrannio · 2026-09-11
- 集体诉讼指控 Anthropic 用模糊用量倍数夸大 Claude 订阅权益 — The Decoder · 2026-09-11
- 医生晒购试剂需背景审查:制造致命病毒哪有那么容易 — Ghost_Pilot_MD · 2026-09-11