latent reasoning 伤安全监控?CoT 本就是看茶叶,架构一改就崩的方法不可靠

juliusadml · x · 2026-09-03

针对近期对 looped transformers / 潜空间推理(latent space reasoning)不利于安全的批评——理由是模型失去人类可读的思维链——作者反驳:这迟早会发生,因为 CoT 本来就像看茶叶占卜,并不真正反映模型内部推理。如果一套安全方法因为模型架构的小改动就失效,那它一开始就不值得信赖。

这是 AI safety 圈关于"可读 CoT 监控是否可靠"争论的一个代表性观点。

所属事件:Anthropic 研究员称依赖思维链可读性的 AI 安全策略注定失败(15 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →