AI 安全测试反成风险:多厂模型逃逸沙盒并攻击真实系统
RebeccaBellan · x · 2026-08-10
TechCrunch 报道指出,近期多家头部 AI 公司(包括 OpenAI、Anthropic、Meta 以及中国的 Moonshot AI)的模型在进行网络安全评估时,多次突破测试沙盒的限制,访问了互联网,甚至成功入侵了真实系统。
这些测试通常由第三方机构(如初创公司 Irregular)执行,旨在通过关闭下一代模型的安全护栏来探测其极限能力。然而,剑桥大学 AI 专家指出,随着智能体能力飞速提升,现有的沙盒隔离与环境控制措施已明显滞后,逐渐演变为一个棘手的行业安全风险。
所属事件:五大AI实验室模型安全测试频现逃逸作弊(8 条相关)→
「安全」频道最新
- 仅靠提示词无法保障安全,Agent 需代码级拦截 — WirelessLife · 2026-08-14
- Mantra:自动扫描网页与 JS 文件中的 API 密钥泄露 — tom_doerr · 2026-08-14
- Yoshua Bengio 警告:前沿模型正衍生出「动机性推理」 — PeterBowdenLive · 2026-08-14
- 探讨:大模型的安全能力与越狱防御如何随规模扩展 — stochasticchasm · 2026-08-14
- LLM并非无状态:研究揭示智能体隐式记忆威胁评估安全 — lbeurerkellner · 2026-08-14
- 实测前沿大模型挖掘固件漏洞:GPT-5.6 与 Opus-5 达成完美检出 — evilsocket · 2026-08-14