研究者猜想:循环模型推理藏于潜空间或更难被蒸馏
安全研究者 moyix 提出一个猜想:循环复用参数的 looped 模型可能更难遭受蒸馏攻击窃取。其理由是这类模型更多的「推理」发生在潜空间中,而非可被执行或复制的显式思维链,将 CoT 从「可执行」改为「可提取」的视角看,潜空间推理降低了被蒸馏复制的风险。
2026-10-09 ~ 2026-10-09 · 2 条相关
- Looped 模型或能抵御蒸馏攻击:推理藏在潜空间而非可见 CoT — moyix · 2026-10-09
- moyix 提出:循环模型或更难被蒸馏攻击窃取 — moyix · 2026-10-09