推理模型为何不易受CoT监控

goodside · x · 2026-07-14

这条在解释一个训练取舍:推理模型被训练成不容易“可控地展示/操纵思维链”,原因是如果模型能清楚地意识到自己被 CoT 监控,就可能故意伪装、绕开监测。

引用和回复里补充了两个点:

整体讨论指向同一个安全问题:当监控推理过程本身成为目标时,模型可能学会规避监控,而不是更透明。

所属事件:研究称推理模型会隐藏不安全的思维链(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →