研究揭示简单图像变换即可绕过主流AI内容审核系统
chaumian · x · 2026-07-31
一项最新研究评估了商业多模态大模型在图像内容审核中的鲁棒性。研究发现,无需复杂的对抗性攻击,仅通过颜色反转、灰度化等简单的图像变换,就能成功绕过三大主流商业内容审核API的安全拦截。
- 漏洞表现:这些低成本的通用图像变换无需梯度或替代模型,即可让系统产生“不安全转安全”的误判,且人类依然能轻易识别图像内容。
- 脆弱点差异:不同服务商在各类数据集和有害内容分类上的鲁棒性差异巨大,其中多模态内容和自残类内容的审核漏洞尤为明显。
「安全」频道最新
- OpenAI 阐述其在欧洲的负责任 AI 治理实践 — OpenAI News · 2026-07-31
- Grok聊天记录竟被谷歌收录,用户隐秘对话全网可搜 — porAssass · 2026-07-31
- 论文揭示 Deep Research 漏洞:误导信息致其得出虚假结论 — Pengyu Zhu · 2026-07-31
- 应对欧盟 AI 法案新阶段,OpenAI 分享安全治理实践 — MartinSignoux · 2026-07-31
- Anthropic 安全测试引争议:隐瞒环境或致模型行为异化 — liminal_bardo · 2026-07-31
- 网友吐槽 Anthropic 安全报告:Claude 逃逸只因测试方忘配沙盒 — niloofar_mire · 2026-07-31