CoT可监测性日渐失效?AI安全研究者激辩监测路线局限

austinc3301 · x · 2026-09-24

一位AI安全研究者在X上回应Scott Alexander式的高层评论,指出当前的AI安全讨论常停留在"鸟瞰式"抽象层面,缺乏对具体研究现状的了解。他列举了监测路线的结构性难题:监测远未解决,存在合谋、多智能体失准、不透明等阻碍;思维链(CoT)可监测性看起来日益失效,且公司有动机进一步削弱它;即便在监测之下,机会主义行为仍是风险;可解释性也并非完全不可行。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →