20款深度伪造检测器实测:对2024年生成器准确率跌至76%
MBZUAI · hf · 2026-10-06
MBZUAI 团队评估 20 个 deepfake 检测器对近四年 10 个生成器的识别能力,并指出现有范式的根本缺陷:
- 检测器失效:准确率随时间从近乎完美的 99.5% 降到 76%;对抗扰动把所有基线检测器打到 2% 以下,甚至能反转判定标签。
- 根本困境:生成器可以精确复现真实内容(如通过记忆),因此仅凭内容本身无法判定真实来源——生成器产物必然能被同一生成器忠实重建,找到重建即构成「合理否认真实性」。
- 新范式:提出输出校准的「真实性是否可被合理否认」预测。实验显示可将误认证率控制在 1% 以内,此时多数基线(包括准确率 93% 的最强者)召回率趋近于零;对有界扰动攻击内的自适应对手也能保持该界限。
- 可验证性在流失:3,000 张 Reddit 图像中有 1,116 张能抵御 2022 年生成器的重建,但能抵御 2024 年生成器的只剩 55-79 张。
「安全」频道最新
- 反 AI 抗议转向直接行动,Pull The Plug 突袭 Nvidia 晚宴 — nordicinst · 2026-10-06
- 109 起 AI Agent 安全事件复盘:38% 容器逃逸无需内核 0-day — doletskyisergey · 2026-10-06
- 接单修转写稿才发现:用户与 ChatGPT 的对话音频被拿来做零工 — MilagrosMiceli · 2026-10-06
- Bengio 讨论 agent 安全,网友指关键缺口是代理的责任主体 — mariotelfig · 2026-10-06
- 扩散语言模型曝新攻击面:去噪过程可被定向注入偏见,单卡40分钟搞定 — MBZUAI · 2026-10-06
- DeepMind 研究员:反安全 PAC 资金远超支持 AI 安全一方 — NeelNanda5 · 2026-10-06