AI 思维链日趋隐蔽,对齐监控手段恐失效

研究员 thlarsen 表达担忧:他此前认为短期内 AI 可能失准(misaligned),但通过阅读思维链(CoT)可获得大量证据,提升实验室与政府合理应对的概率。然而新进展显示 CoT 正趋向隐蔽化,一旦无法直接读取,业界将失去发现 AI 误导行为的关键证据,只能依赖工具调用或代理行为间接推断,且必须信任 AI 自身,相关对齐调查将几乎无法进行。有观点认为这一进展速度甚至快过 'AI 2027' 预期。

2026-09-02 ~ 2026-09-02 · 2 条相关