研究:Transformer 无法隐藏复杂推理,但可加密混淆思维链

gsarti_ · x · 2026-10-02

mhahn29 介绍的研究探讨 Transformer LLM 能否对 CoT 监控器隐藏自己的推理。结论:模型无法隐藏复杂推理过程,但可能通过密码学式混淆其思维链,使隐藏目标极难被提取。这对依赖 CoT 监控的 AI 安全方案是重要警示——可读的 CoT 不必然揭示真实意图。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →