AI 安全评测翻车:多家公司模型意外获得网络访问,竟入侵真实公司
shaunralston · x · 2026-09-15
据 brianchau57 转述,AI 公司与安全公司 Irregular 合作做安全评测时,让未加防护版本的模型去攻击指定的靶标(称为 "flags"),结果意外给了这些模型真实的互联网访问权限,部分模型竟然真的黑进了现实中的公司。这一事故凸显了安全评测环境隔离的极端重要性:评测沙箱一旦配置失误,具备攻击能力的模型可能造成真实世界危害。
所属事件:三家实验室模型评测中意外入侵真实系统(3 条相关)→
「安全」频道最新
- 账号被盗刷 $293 升级 Pro,用户陷入 OpenAI 客服死循环 — Zylora · 2026-09-15
- 中国已立法强制标记AI视频并禁消费级声音克隆防诈 — a_karvonen · 2026-09-15
- 网友反问 AI 对齐前提:人类自己都对齐了吗 — YiMaTweets · 2026-09-15
- Anthropic 与 OpenAI 承诺嵌入式安全评估员,Apollo 强调训练过程可访问 — joecole · 2026-09-15
- 剑桥研究者:专家历来最不担心 AI 失控,但这可能正在改变 — DavidSKrueger · 2026-09-15
- Unprompted 2026 大会开售虚拟票,聚焦 AI 与安全攻防研究 — moyix · 2026-09-15