CoT 可解释性为何天然脆弱:专家论证不可见激活无法构成审计记录
GaryMarcus · x · 2026-09-03
Gary Marcus 引用并认同一种担忧:自然语言思维链的可解释性「从来都脆弱到不足以作为长期 AI 安全的兜底」,但在更好方案出现前就拆掉脚手架是疯狂的。@williamtp 深入解释了结构性原因:学习到的机制存于权重中,大量运行时计算藏在激活里,CoT 只能暴露真实过程的一部分,我们看到的文字并非决定答案的完整记录。他主张更强的方向是让信任攸关的推理发生在可检查的符号基底上——每一步可见的计算决定下一步,此时 trace 不再是模型对自己推理的「叙述」,trace 本身就是推理,监控才能真正保障安全。这与 OpenAI 削弱 CoT 可监控性的动向直接相关。
所属事件:OpenAI 新技术削弱 CoT 可监控性,AI 安全圈激辩监控替代方案(32 条相关)→
「安全」频道最新
- NVIDIA 开源工具可提前扫描 AI agent skills 安全风险 — Roger_M_Taylor · 2026-09-03
- 报告:2025 年 67% 汽车网络攻击涉及后端服务器 — moniquejmorrow · 2026-09-03
- Mallow 主张:机器人应当是物理隔离的气隙系统 — mallow610 · 2026-09-03
- 本地数据中心≠主权AI:1024卡集群年耗水超3000万升 — Arc_bong · 2026-09-03
- 又一批 AI 生成假记者身份被 Press Gazette 揭露 — RobWaugh74 · 2026-09-03
- 卫报播客:聊天机器人如何把用户拖进「AI 心理依赖」漩涡 — nordicinst · 2026-09-03