Anthropic 研究员:依赖思维链可读性的安全策略注定失败

inductionheads · x · 2026-09-02

Anthropic 研究员 jachiam0 发表争议观点:思维链(CoT)可解释性从一开始就注定过于脆弱,不足以作为长期 AI 安全的兜底手段。他认为保护 CoT 保真度的努力有价值,但把「思维链必须对人类可读」上升为原则并不合理——基于该原则的策略最终必然失效,不应依赖它或从中获得持久的安全感;让模型可理解的努力应远超 CoT 保真度。Marcus 反驳类比:依赖 CoT 监控安全就像靠代码评审保证代码正确,本就该有更稳健的手段。

所属事件:Anthropic 研究员称依赖思维链可读性的 AI 安全策略注定失败(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →