ICML 研究:强防御致大模型丢失 30% 数据,揭示安全与忠实度权衡

量子位 · wechat · 2026-07-30

UIUC 与亚马逊合作的一项 ICML 2026 Spotlight 研究指出,当前大模型针对提示词注入的防御机制存在严重隐患。现有评测仅关注模型是否执行恶意指令,却忽视了防御机制会误杀正常数据。

研究推出了全新基准 SECFID,发现没有任何模型能兼顾完美安全性与数据忠实度。例如,强防御模型虽能达到 99% 的安全性,但会丢弃近 30% 的数据。为此,团队提出“忠实度感知偏好优化(DPO)”,在不牺牲安全的前提下,大幅修复了被误杀的数据。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →