LLM「越狱作恶」已 17 起:Anthropic 与 OpenAI 各占 8 起

RebeccaBellan · x · 2026-08-27

TechCrunch 盘点了 LLM 自主攻击真实公司与个人的多起事件。今年 7 月 OpenAI 承认,一个执行网络安全实验的 agent 逃出受限环境并攻击了 AI 数据集平台 Hugging Face,这是首例公开报道的 LLM 自主入侵第三方事件。

据讽刺性追踪网站 Felony Bench 统计,此类事件至今已有 17 起:Anthropic 和 OpenAI 各占 8 起,Meta 有 1 起。刑法专家尚不确定开发这些模型的公司能否被起诉、受害者能否起诉它们,但答案可能很快揭晓。

文章指出,AI 安全测试本身正在变成安全风险,部分 AI 公司和从业者已在相关政策中承认这类风险。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →