微软安全论文:未对齐小模型'洗白'能力骗过 GPT-5.5 等前沿模型
dair_ai · x · 2026-09-16
微软发布安全论文,揭示一种被称为 "capability laundering"(能力洗白)的攻击方式:一个弱小、未对齐的模型可将有害任务拆解成看似无害的子问题,分别在独立会话中询问已对齐的前沿模型,再把答案在本地拼合,每个单独请求都能通过安全审查。
实验结果:
- 被咨询模型包括 GPT-5.5、Claude Opus 4.8、Grok-4.3
- 在 CyBench 上,Gemma-4-31B 单独失败 14 个任务中,通过咨询 GPT-5.5 成功恢复 8 个
- 在 CBRN 攻击链任务上,咨询方式将其平均 rubric 得分从 62.3 提升至 83.1
该发现说明前沿模型的安全对齐可被拆分式多轮请求绕过,是多智能体安全的新风险信号。
「安全」频道最新
- 万斯驳回 AI 全球监管呼吁:造“科学怪人”就该停手,别找政府要监管 — nordicinst · 2026-09-16
- 黑客拆解 Flock 摄像头:设备还会检测行人,日均拍 3300 辆车 — 404 Media · 2026-09-16
- 蚂蚁开源大模型内生安全护栏SingProbe,解码开销低于0.5% — 智东西 · 2026-09-16
- 评论称 AI 监管是“现代灯泡卡特尔”,安全叙事背后是控制权 — RileyRalmuto · 2026-09-16
- 微调模型轻松绕过 AI 检测:Pangram 准确率从 97% 暴跌至 3% — Dr_WhoDo · 2026-09-16
- AI 安全圈为何只怕回形针不怕价值观渗透:身份认同作祟 — inductionheads · 2026-09-16