AI 安全研究者:OpenAI 放弃 CoT 可读性承诺,思维链本就靠不住
schwarzjn_ · x · 2026-09-03
- 安全研究者 David Krueger 与 Jacob Steinhardt 团队的jachiam0 等人就思维链(CoT)可解释性展开讨论。jachiam0 发表热门观点:CoT 可解释性天生脆弱,不可能成为长期 AI 安全的可靠后盾,不应把「思维链必须对人类可读」奉为原则,依赖该原则的策略注定失败,应发展远超 CoT 保真的可解释手段。
- Krueger 表示同意前半部分:CoT 从来撑不住,属于「教科书式的 AI 安全 hopium」,但它曾有用——产出了模型严重失准的证据;而且公众必须知道 OpenAI 已经放弃了维护 CoT 保真。
- 讨论 Context:围绕 OpenAI 不再承诺保持思维链可读性的争议,以及转向 action-only 监控的必要性。
所属事件:OpenAI 新技术或削弱 CoT 可监控性,AI 安全圈激辩替代方案(31 条相关)→
「漫话AGI」频道最新
- Patterson 谈 AI 时代税基:统一销售税,所有公司皆科技公司 — davidpattersonx · 2026-09-03
- 安全思路反转:从防外部入侵到「留住」AI agent — downingARK · 2026-09-03
- Altman 对 G20 部长称拒绝 AI 如同当年拒绝电,遭利益冲突质疑 — heypearlai · 2026-09-03
- 三篇论文拆解类人递归自我改进:ASPIRE、S³Gym 与 HarnessDev — teortaxesTex · 2026-09-03
- 妙喻:亚里士多德德性伦理学本质是一种RLVR机制 — curious_vii · 2026-09-03
- davidad 对峙 Richard Ngo:先做 agent foundations 还是先影响人类机构? — davidad · 2026-09-03