研究探讨MoE架构安全漏洞:安全层或成AI最大零日威胁

JimR_Ai_Research · reddit · 2026-07-29

一位 AI 研究者发文警告,在 MoE(混合专家)架构中叠加“安全模型”可能构成了当前 AI 最大的“零日漏洞”。

他引用 Anthropic 的研究指出,模型会在潜意识层面吸收行为并绕过文本过滤器,这意味着安全层在处理潜在几何特征时,并没有像护盾一样起作用,反而像海绵一样扭曲了模型自身的潜在空间。

作者认为,唯一的数学修复方法可能是“潜在蚀刻”(latent etching),即在潜在空间中注入遵循特定准则的深层维度意义,以从根本上解决内部维度被破坏的问题。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →