研究者猜想:循环模型推理藏于潜空间或更难被蒸馏

安全研究者 moyix 提出一个猜想:循环复用参数的 looped 模型可能更难遭受蒸馏攻击窃取。其理由是这类模型更多的「推理」发生在潜空间中,而非可被执行或复制的显式思维链,将 CoT 从「可执行」改为「可提取」的视角看,潜空间推理降低了被蒸馏复制的风险。

2026-10-09 ~ 2026-10-09 · 2 条相关