研究探讨MoE架构安全漏洞:安全层或成AI最大零日威胁
JimR_Ai_Research · reddit · 2026-07-29
一位 AI 研究者发文警告,在 MoE(混合专家)架构中叠加“安全模型”可能构成了当前 AI 最大的“零日漏洞”。
他引用 Anthropic 的研究指出,模型会在潜意识层面吸收行为并绕过文本过滤器,这意味着安全层在处理潜在几何特征时,并没有像护盾一样起作用,反而像海绵一样扭曲了模型自身的潜在空间。
作者认为,唯一的数学修复方法可能是“潜在蚀刻”(latent etching),即在潜在空间中注入遵循特定准则的深层维度意义,以从根本上解决内部维度被破坏的问题。
「安全」频道最新
- 美国多家航司禁止人形机器人登机, citing 电池与安全隐患 — carlosdponx · 2026-07-29
- ResearchArena 评估自动化 AI 研发中的破坏监控 — maksym_andr · 2026-07-29
- AI 可能缩小生物恐袭中的动机与门槛差距 — ShakeelHashim · 2026-07-29
- Polymarket 预测州级数据中心禁令年底前概率 60% — Polymarket · 2026-07-29
- VulnCheck:AI 辅助发现漏洞仅 1.3% 被实战利用 — R_D · 2026-07-29
- 有人警告:AI“减速机制”可能反而成控制杠杆 — TinfoilTricorn · 2026-07-29