ICML论文揭示大模型指令跟踪存在根本缺陷

据MIT Technology Review报道,一篇在ICML发表的重磅论文指出,大语言模型在识别指令来源时存在根本性的底层缺陷。由于模型难以区分系统指令与用户输入,这种缺陷导致其极易被攻击者诱导执行危险指令,现有的安全护栏也很容易被绕过或越狱。研究认为,该问题属于大模型架构层面的顽疾,几乎无法被彻底修复。

2026-07-30 ~ 2026-07-30 · 2 条相关