黑盒攻击可绕过 T2I 模型安全微调,被擦除概念可被复活

pinyuchenTW · x · 2026-08-02

一项被 COLM 2026 接收的研究(ICER)指出,经过安全微调的文本生成图像(T2I)模型虽然本应擦除了裸露等危险概念,但攻击者仅通过黑盒方式就能将这些概念重新提取出来。该过程无需获取梯度、无需借助智能体或辅助视觉语言模型(VLM),模型依然会保留对过往有效模式的记忆。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →