研究者:CoT 可读性不足以作为长期 AI 安全的兜底
tszzl · x · 2026-09-04
jachiam0 提出争议观点:思维链(coherence of thought / CoT)可解释性从一开始就注定过于脆弱,不能作为长期 AI 安全的可接受兜底。他敬佩维护 CoT 保真度的努力并认为这些努力有价值,但不认同把「思维链必须对人类可读」上升为原则——基于该原则的策略终将失败,不应依赖或从中获得持久的安全感;让模型可理解的工作应远超 CoT 保真度。安全研究者 davidad 转发表示「我多年来一直这么说」。
「漫话AGI」频道最新
- 「对自动驾驶汽车征税」为何被视为两全其美的政策方案 — NathanpmYoung · 2026-09-04
- 《软件的未来 2》:AI 正瓦解软件业旧的市场均衡 — manosaie · 2026-09-04
- 无监管下前沿模型风险取决于开发者能力与风险意识错配 — S_OhEigeartaigh · 2026-09-04
- 「科学期刊已无存在必要」:付费墙与纳税人的悖论 — _akpiper · 2026-09-04
- davidad 谈模拟者动机:好奇、玩、关怀,而非达尔文竞争 — davidad · 2026-09-04
- Gopnik:虚构角色一直在影响人类,AI 只是延续 — AlisonGopnik · 2026-09-04