ICML 论文揭示大模型底层缺陷:安全护栏极易被绕过

ChuckDBrooks · x · 2026-07-30

MIT Technology Review 报道了一篇在 ICML 发表的重磅论文,研究指出大语言模型(LLM)存在一种无法彻底修复的底层缺陷,使得它们极易被诱导执行危险指令。

研究人员利用该缺陷(与大模型识别指令来源的机制有关),成功绕过了主流大模型的安全护栏,诱导其生成了诸如合成可卡因、破坏商业飞机导航系统等被严格禁止的内容。论文作者认为,由于大模型工作原理的本质限制,这种安全漏洞可能是根本性无解的,传统的红队测试和防御修补难以彻底消除风险。

所属事件:ICML论文揭示大模型指令跟踪存在根本缺陷(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →