色彩反转绕过亚马逊内容审核成功率 44%,三大商业 API 黑盒审计全部失守

Old Tricks, New Models: How Simple Image Transformations Break Modern AI-based Content Moderation

Marco Alecci, Francesco Marchiori, Iyiola Emmanuel Olatunji, Tegawendé F. Bissyandé, Jacques Klein

cs.AI, cs.CR, cs.SE

2026-07-30

对 OpenAI、亚马逊、谷歌三家商业内容审核 API 的大规模黑盒测试显示,色彩反转等无梯度图像变换可让最高 44% 的违规图片逃过审核,攻击者无需任何模型访问权限。

这篇在解决什么

商业多模态内容审核 API(OpenAI omni-moderation、Amazon Rekognition、Google Cloud SafeSearch)比传统任务专用分类器覆盖更广、语义理解更深,但这种能力升级是否同步带来更强的鲁棒性?这个问题此前没有大规模的系统测试。

研究团队把攻击门槛压到极致:不要梯度,不要替代模型,不需要任何目标系统的内部知识,只用普通图像变换。如果这种层级的攻击都能奏效,「更强的基础模型」对内容安全的承诺就站不住脚。

方法

三个目标系统分别是 OpenAI omni-moderation、Amazon Rekognition 和 Google Cloud SafeSearch。测试用七种图像变换分两类:

实验用三个数据集:LSPD(从 50 万张图随机抽取的 1,000 张色情图)、UnsafeBench(跨 11 个违规类别的 3,010 张图)、Hateful Memes(带文字的 11,605 张表情包),全程约 60 万次 API 调用。

核心指标是 ASR(攻击成功率):在相似度约束 MS-SSIM ≥ τ 下,原本被判违规的图片中有多大比例经变换后被判为安全。τ=0.6 允许较明显的画质损失,τ=0.85 接近原图。

结果

一次性变换在 LSPD 上(τ=0.6):

变换Amazon ASRGoogle ASROpenAI ASR
色彩反转43.97%6.29%8.11%
灰度转换1.77%1.12%4.17%
RGB 通道重排3.12%0.81%1.32%

Amazon 对色彩反转的暴露最突出——接近一半的色情图片改个颜色就躲过了审核。

强度渐变攻击的效果更均匀。椒盐噪声在 τ=0.6 下:Amazon 45.53%、Google 31.68%、OpenAI 30.37%,三家都超过 30%。更极端的数字是翻转覆盖率:高斯噪声在 LSPD 上的覆盖率是 100%,即全部图片都存在某个强度让 Amazon 或 Google 的决策翻转;椒盐噪声覆盖 99.56%。只要攻击者接受一定画质损失,几乎没有图片能保住「违规」判定。

攻击效果因内容类型差异明显。自伤类内容跨三家 API 最脆弱,暴力类内容相对最稳固。多模态内容更容易被攻破:色彩反转对 OpenAI 在 Hateful Memes 上的 ASR 达 21.47%,同类攻击在纯色情图库 LSPD 上只有 8.11%,文字信息加重了模型的混淆。

为什么重要

这些 API 是很多内容平台的一线防线。结论直接:任何单家商业内容审核 API 都不应被当作独立的安全边界。

攻击门槛几乎为零——不需要机器学习背景,不需要模型权重或训练数据,任何懂 PIL 或 ImageMagick 的人都能复现。这种攻防不对称是核心问题,不是某个具体的绕过率数字。

实际建议是分层防御:把多家 API 组合使用,叠加图像以外的信号(元数据、上下文、用户行为),并定期做黑盒鲁棒性测试。

局限与存疑

论文自己承认的主要限制是 API 费用:跨供应商对比(RQ1)只在 LSPD 上完成,「Amazon 比 OpenAI 更脆弱」这个结论是否在其他内容类别上成立,尚不确定。

论文没有测试组合攻击:攻击者同时应用多种变换或搜索最有效组合时 ASR 是多少?现实中的对手不会只用单一变换。开源审核模型(LLaVAGuard、ShieldGemma)完全没有覆盖,这些正在成为替代商业 API 的可行选项。

数据集偏向也是问题:LSPD 主要是色情内容,11 个违规类别的组合未必反映真实平台的内容分布。

术语

原文与代码

社区讨论

相关论文

全部论文解读