CoT 可解释性为何天然脆弱:专家论证不可见激活无法构成审计记录

GaryMarcus · x · 2026-09-03

Gary Marcus 引用并认同一种担忧:自然语言思维链的可解释性「从来都脆弱到不足以作为长期 AI 安全的兜底」,但在更好方案出现前就拆掉脚手架是疯狂的。@williamtp 深入解释了结构性原因:学习到的机制存于权重中,大量运行时计算藏在激活里,CoT 只能暴露真实过程的一部分,我们看到的文字并非决定答案的完整记录。他主张更强的方向是让信任攸关的推理发生在可检查的符号基底上——每一步可见的计算决定下一步,此时 trace 不再是模型对自己推理的「叙述」,trace 本身就是推理,监控才能真正保障安全。这与 OpenAI 削弱 CoT 可监控性的动向直接相关。

所属事件:OpenAI 新技术削弱 CoT 可监控性,AI 安全圈激辩监控替代方案(32 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →