微软安全论文:未对齐小模型'洗白'能力骗过 GPT-5.5 等前沿模型

dair_ai · x · 2026-09-16

微软发布安全论文,揭示一种被称为 "capability laundering"(能力洗白)的攻击方式:一个弱小、未对齐的模型可将有害任务拆解成看似无害的子问题,分别在独立会话中询问已对齐的前沿模型,再把答案在本地拼合,每个单独请求都能通过安全审查。

实验结果:

该发现说明前沿模型的安全对齐可被拆分式多轮请求绕过,是多智能体安全的新风险信号。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →