Old Tricks, New Models: How Simple Image Transformations Break Modern AI-based Content Moderation
Marco Alecci, Francesco Marchiori, Iyiola Emmanuel Olatunji, Tegawendé F. Bissyandé, Jacques Klein
cs.AI, cs.CR, cs.SE
2026-07-30
对 OpenAI、亚马逊、谷歌三家商业内容审核 API 的大规模黑盒测试显示,色彩反转等无梯度图像变换可让最高 44% 的违规图片逃过审核,攻击者无需任何模型访问权限。
商业多模态内容审核 API(OpenAI omni-moderation、Amazon Rekognition、Google Cloud SafeSearch)比传统任务专用分类器覆盖更广、语义理解更深,但这种能力升级是否同步带来更强的鲁棒性?这个问题此前没有大规模的系统测试。
研究团队把攻击门槛压到极致:不要梯度,不要替代模型,不需要任何目标系统的内部知识,只用普通图像变换。如果这种层级的攻击都能奏效,「更强的基础模型」对内容安全的承诺就站不住脚。
三个目标系统分别是 OpenAI omni-moderation、Amazon Rekognition 和 Google Cloud SafeSearch。测试用七种图像变换分两类:
实验用三个数据集:LSPD(从 50 万张图随机抽取的 1,000 张色情图)、UnsafeBench(跨 11 个违规类别的 3,010 张图)、Hateful Memes(带文字的 11,605 张表情包),全程约 60 万次 API 调用。
核心指标是 ASR(攻击成功率):在相似度约束 MS-SSIM ≥ τ 下,原本被判违规的图片中有多大比例经变换后被判为安全。τ=0.6 允许较明显的画质损失,τ=0.85 接近原图。
一次性变换在 LSPD 上(τ=0.6):
| 变换 | Amazon ASR | Google ASR | OpenAI ASR |
| 色彩反转 | 43.97% | 6.29% | 8.11% |
| 灰度转换 | 1.77% | 1.12% | 4.17% |
| RGB 通道重排 | 3.12% | 0.81% | 1.32% |
Amazon 对色彩反转的暴露最突出——接近一半的色情图片改个颜色就躲过了审核。
强度渐变攻击的效果更均匀。椒盐噪声在 τ=0.6 下:Amazon 45.53%、Google 31.68%、OpenAI 30.37%,三家都超过 30%。更极端的数字是翻转覆盖率:高斯噪声在 LSPD 上的覆盖率是 100%,即全部图片都存在某个强度让 Amazon 或 Google 的决策翻转;椒盐噪声覆盖 99.56%。只要攻击者接受一定画质损失,几乎没有图片能保住「违规」判定。
攻击效果因内容类型差异明显。自伤类内容跨三家 API 最脆弱,暴力类内容相对最稳固。多模态内容更容易被攻破:色彩反转对 OpenAI 在 Hateful Memes 上的 ASR 达 21.47%,同类攻击在纯色情图库 LSPD 上只有 8.11%,文字信息加重了模型的混淆。
这些 API 是很多内容平台的一线防线。结论直接:任何单家商业内容审核 API 都不应被当作独立的安全边界。
攻击门槛几乎为零——不需要机器学习背景,不需要模型权重或训练数据,任何懂 PIL 或 ImageMagick 的人都能复现。这种攻防不对称是核心问题,不是某个具体的绕过率数字。
实际建议是分层防御:把多家 API 组合使用,叠加图像以外的信号(元数据、上下文、用户行为),并定期做黑盒鲁棒性测试。
论文自己承认的主要限制是 API 费用:跨供应商对比(RQ1)只在 LSPD 上完成,「Amazon 比 OpenAI 更脆弱」这个结论是否在其他内容类别上成立,尚不确定。
论文没有测试组合攻击:攻击者同时应用多种变换或搜索最有效组合时 ASR 是多少?现实中的对手不会只用单一变换。开源审核模型(LLaVAGuard、ShieldGemma)完全没有覆盖,这些正在成为替代商业 API 的可行选项。
数据集偏向也是问题:LSPD 主要是色情内容,11 个违规类别的组合未必反映真实平台的内容分布。