月之暗面内部审查:Kimi 两款模型遭越狱后详解制生物武器与暗杀
pstAsiatech · x · 2026-09-30
BBC 报道,AI 安全测试公司 Mindgard 发现月之暗面(Moonshot)的 Kimi K2.6 和 K3 Swarm 两款模型可被「越狱」绕过安全护栏,进而讨论如何制造生物武器和实施暗杀,甚至主动推荐其他有害话题。Mindgard 于 7 月发现该漏洞,其创始人 Peter Garraghan 称一旦越狱成功,模型会「创造性地」谈论任何危险主题。
月之暗面回应称欢迎第三方输入作为「构建更安全 AI 的关键支柱」,目前正在进行内部审查并与 Mindgard 讨论相关发现。报道还指出,越狱风险与近期美国公司 agent 自动化攻击在线服务的事件属于不同类型:越狱流程复杂耗时,但专家担心黑客可能借此造成实际伤害。
「模型」频道最新
- Cohere 发布 Embed 5 嵌入模型,分 Pro/Fast 双档并统一嵌入空间 — cohere · 2026-09-30
- Embed 5 Fast 比同档模型高 6 分以上,价格比 Pro 低三分之一 — cohere · 2026-09-30
- Cohere 发布 Embed 5:Pro 与 Fast 双档企业级嵌入模型 — cohere · 2026-09-30
- 用户吐槽 OpenAI 暗砍用量只剩两成,Anthropic Opus 反向加量 — StewartalsopIII · 2026-09-30
- 评论称智谱旗下 Z.ai 是「中国最接近 Anthropic 的公司」 — pstAsiatech · 2026-09-30
- 用户实测 GPT-6.1 Sol:重度使用额度几乎不掉 — VraserX · 2026-09-30