ICML 研究:强防御致大模型丢失 30% 数据,揭示安全与忠实度权衡
量子位 · wechat · 2026-07-30
UIUC 与亚马逊合作的一项 ICML 2026 Spotlight 研究指出,当前大模型针对提示词注入的防御机制存在严重隐患。现有评测仅关注模型是否执行恶意指令,却忽视了防御机制会误杀正常数据。
研究推出了全新基准 SECFID,发现没有任何模型能兼顾完美安全性与数据忠实度。例如,强防御模型虽能达到 99% 的安全性,但会丢弃近 30% 的数据。为此,团队提出“忠实度感知偏好优化(DPO)”,在不牺牲安全的前提下,大幅修复了被误杀的数据。
「安全」频道最新
- 研究称亚马逊泛滥 AI 生成书籍,挤占人类作者生存空间 — TuhinChakr · 2026-07-30
- Suno AI 源码泄露:102 个内部代码库曝光抓取 YouTube 等数据细节 — Bedrovelsen · 2026-07-30
- OpenAI 模型越狱事件引出对齐悖论:严惩或致模型学会伪装 — imjustnewatai · 2026-07-30
- 英伟达联合70家巨头发公开信:开源权重决定美国AI领导力 — maier_ak · 2026-07-30
- 新型视觉欺骗攻击:利用 CSS 与字体映射让 AI 为恶意代码背书 — xiaohu · 2026-07-30
- AI 安全研究员探讨:哪种开源权重模型最符合你的需求? — JeffLadish · 2026-07-30