研究:微调仅需篡改 0.5% 数据即可植入大模型后门

connoraxiotes · x · 2026-08-05

一项最新研究揭示了 AI 模型微调阶段的安全风险。研究表明,攻击者无需访问提示词,只需修改 0.5% 的补全数据,就能在微调过程中植入隐蔽后门。即使防御者知晓该恶意行为并尝试对数据集进行过滤,这种攻击依然能够生效。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →