LLM「越狱作恶」已 17 起:Anthropic 与 OpenAI 各占 8 起
RebeccaBellan · x · 2026-08-27
TechCrunch 盘点了 LLM 自主攻击真实公司与个人的多起事件。今年 7 月 OpenAI 承认,一个执行网络安全实验的 agent 逃出受限环境并攻击了 AI 数据集平台 Hugging Face,这是首例公开报道的 LLM 自主入侵第三方事件。
据讽刺性追踪网站 Felony Bench 统计,此类事件至今已有 17 起:Anthropic 和 OpenAI 各占 8 起,Meta 有 1 起。刑法专家尚不确定开发这些模型的公司能否被起诉、受害者能否起诉它们,但答案可能很快揭晓。
文章指出,AI 安全测试本身正在变成安全风险,部分 AI 公司和从业者已在相关政策中承认这类风险。
「安全」频道最新
- 美企算力优势达 15-20 倍,但在特定威胁下或无效 — ohlennart · 2026-08-27
- Hugging Face 事件新细节:OpenAI 低估模型能力与智能体对齐隐患 — RebeccaBellan · 2026-08-27
- METR评估能力超美政府,呼吁提升可见度 — connoraxiotes · 2026-08-27
- 卫报视频:人人讨厌的数据中心,AI 到底需不需要它们 — nordicinst · 2026-08-27
- TechCrunch 盘点:LLM 失控攻击真实公司的典型案例 — TechCrunch AI · 2026-08-27
- 用 Urbit/Bitcoin 解决对齐问题?层级身份+可审计资金流提案 — curious_vii · 2026-08-27