Llama-3.1-8B 剪枝越狱:仅改校准集拒答率 96% 降至 13%
Tanmoy_Chak · x · 2026-08-30
IIT Delhi 研究揭示结构化剪枝的“校准陷阱”:攻击者只需篡改用于决定权重删除的校准集,就能破坏模型安全。实验显示,被攻击的 Llama-3.1-8B 对有害提示的拒答率从 96% 骤降至 13%。
- 攻击原理:结构化剪枝依赖小批量校准集计算重要性分数,篡改该数据集即控制剪枝决策,植入后门。
- 影响范围:非结构化剪枝不受影响,因无此校准步骤;免校准剪枝方法则天然免疫此攻击。
- 防御建议:研究建议使用鲁棒的校准数据集,或转向免校准剪枝架构。
「安全」频道最新
- 行业逃避责任:撞车坐牢 vs AI作恶免责 — iamtrask · 2026-08-30
- 模型评估论文:区分能力评测与倾向评测 — sjgadler · 2026-08-30
- CIO 们正头疼 AI 经济学与智能体治理 — perilli · 2026-08-30
- AI 自动执法是利是弊?改革机会与过渡阵痛 — sebkrier · 2026-08-30
- AI 训练数据包含安全事件,或重塑模型行为 — iamtrask · 2026-08-30
- OpenAI 让未部署模型攻防测试意欲何为? — TheStalwart · 2026-08-30