黑盒攻击可绕过 T2I 模型安全微调,被擦除概念可被复活
pinyuchenTW · x · 2026-08-02
一项被 COLM 2026 接收的研究(ICER)指出,经过安全微调的文本生成图像(T2I)模型虽然本应擦除了裸露等危险概念,但攻击者仅通过黑盒方式就能将这些概念重新提取出来。该过程无需获取梯度、无需借助智能体或辅助视觉语言模型(VLM),模型依然会保留对过往有效模式的记忆。
「安全」频道最新
- 学者论文现 AI 幻觉引用,称搜自谷歌学术 — aniketapanjwani · 2026-08-24
- AI 隐私与安全干预:谁来定义“危险”的边界? — Radiant_Dragonfruit3 · 2026-08-24
- 预测市场:年底前美一州实施数据中心禁令概率 68% — Polymarket · 2026-08-24
- 博主拟探讨数据中心反弹与 AI 安全的关联 — AndyMasley · 2026-08-24
- Richard Ngo 将发布对齐研究失误的回顾文章 — RichardMCNgo · 2026-08-24
- 美AI数据中心引发暴力威胁,共和党视其为选举风险 — rohanpaul_ai · 2026-08-24