CoT 监控恐失效:AI 失准更难察觉,进展快过 AI 2027 预期

AaronBergman18 · x · 2026-09-02

研究员 thlarsen 引用新进展表达担忧:他此前认为短期内 AI 会失准(misaligned),但可以通过阅读思维链(CoT)获得大量证据,从而提高实验室和政府合理应对的概率。

如今他仍认为 AI 会失准,但判断我们将失去通过 CoT 察觉的能力——只能依赖工具调用和 agentic 行为来间接判断,且调查会极其困难,因为最终得靠 AI 自我报告它在想什么。他还指出这是「事情进展快于 AI 2027 剧本」的又一例证:Neuralese(神经潜语)相关进展今年 3 月就已开始出现。

所属事件:AI 思维链日趋隐蔽,对齐监控手段恐失效(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →