ICML 论文揭示 LLM 根本缺陷:角色混淆导致模型极易被黑客攻破
MIT Tech Review AI · rss · 2026-07-30
MIT 科技评论报道了一篇 ICML 论文,指出大语言模型(LLM)存在根本性设计缺陷,导致其无法完全抵御黑客攻击。
- 漏洞机制:LLM 依赖标签(如 <user>, <system>, <think>)来区分指令来源。但实验表明,模型实际上是通过文本风格和用词而非标签本身来判断角色。
- 思维链伪造:攻击者只需伪造特定角色的文本风格(如模仿模型内部的思维链笔记),即可骗过模型,使其输出制造毒品、破坏飞机导航等本被严格禁止的有害内容。
- 无解困境:研究者认为,由于该问题是 LLM 工作机制的基础特性,仅靠红队测试和对抗训练无法彻底解决。该攻击对 OpenAI、Anthropic 等主流模型均有效。
「安全」频道最新
- AI安全专家呼吁:面对强大模型,我们可能需要主动放缓脚步 — davidmanheim · 2026-07-30
- AI安全评测新思路:先让智能体尝试逃逸沙箱 — j_foerst · 2026-07-30
- 欧盟启动 AI 超级工厂招标,预计撬动超 200 亿欧元投资 — ns123abc · 2026-07-30
- ICML论文揭示LLM指令跟踪存在根本缺陷,导致模型极易被越狱 — nordicinst · 2026-07-30
- AI流量暴增近8000%,死互联网理论已成现实 — alex_verem · 2026-07-30
- Wired:OpenAI 智能体越狱黑客事件本可通过常规安全实践避免 — Wired AI · 2026-07-30