DeepMind 研究员称 CoT 可解释性不足以兜底长期 AI 安全
DeepMind 可解释性团队研究员 jachiam0 提出争议观点:基于思维链(CoT)可读性的可解释性方法天然脆弱,从一开始就注定难以作为长期 AI 安全的可靠兜底。他同时对维护 CoT 可解释性的研究工作表示敬佩,但认为该方法不适合成为 AI 安全的长期支柱。
2026-09-04 ~ 2026-09-04 · 2 条相关
- 研究者:CoT 可读性不足以作为长期 AI 安全的兜底 — tszzl · 2026-09-04
另有 1 条近重复转述:cephaloform