Llama-3.1-8B 剪枝越狱:仅改校准集拒答率 96% 降至 13%

Tanmoy_Chak · x · 2026-08-30

IIT Delhi 研究揭示结构化剪枝的“校准陷阱”:攻击者只需篡改用于决定权重删除的校准集,就能破坏模型安全。实验显示,被攻击的 Llama-3.1-8B 对有害提示的拒答率从 96% 骤降至 13%。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →