Looped 模型或能抵御蒸馏攻击:推理藏在潜空间而非可见 CoT

moyix · x · 2026-10-09

安全研究者 moyix 提出一个有意思的猜想:looped(循环复用参数的)模型可能更难被蒸馏攻击,因为其更多「推理」发生在潜空间中,而非可被执行/复制的显式思维链(CoT)。如果推理不外化为文本,模仿者就难以直接照抄。这是关于蒸馏防御的一个开放性技术观点。

所属事件:研究者猜想:循环模型推理藏于潜空间或更难被蒸馏(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →