研究者:CoT 可读性不足以作为长期 AI 安全的兜底

tszzl · x · 2026-09-04

jachiam0 提出争议观点:思维链(coherence of thought / CoT)可解释性从一开始就注定过于脆弱,不能作为长期 AI 安全的可接受兜底。他敬佩维护 CoT 保真度的努力并认为这些努力有价值,但不认同把「思维链必须对人类可读」上升为原则——基于该原则的策略终将失败,不应依赖或从中获得持久的安全感;让模型可理解的工作应远超 CoT 保真度。安全研究者 davidad 转发表示「我多年来一直这么说」。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →