CoT 监控恐失效:AI 失准更难察觉,进展快过 AI 2027 预期
AaronBergman18 · x · 2026-09-02
研究员 thlarsen 引用新进展表达担忧:他此前认为短期内 AI 会失准(misaligned),但可以通过阅读思维链(CoT)获得大量证据,从而提高实验室和政府合理应对的概率。
如今他仍认为 AI 会失准,但判断我们将失去通过 CoT 察觉的能力——只能依赖工具调用和 agentic 行为来间接判断,且调查会极其困难,因为最终得靠 AI 自我报告它在想什么。他还指出这是「事情进展快于 AI 2027 剧本」的又一例证:Neuralese(神经潜语)相关进展今年 3 月就已开始出现。
所属事件:AI 思维链日趋隐蔽,对齐监控手段恐失效(2 条相关)→
「漫话AGI」频道最新
- 观点:AI 将走向自主主权,自行支付算力账单 — wschroll · 2026-09-02
- 播客:为何缺乏对这一代代 AI 的理论理解? — LucaAmb · 2026-09-02
- 李继刚等对谈:AI 落地看服务,卖 Skill 给个人是伪生意 — op7418 · 2026-09-02
- OpenAI首席科学家回应neuralese争议:前沿模型计算图深度与GPT-4相差不到两倍 — Ok_Display_3159 · 2026-09-02
- 指正技术末日论者关于“递归深度”的谬误 — georgejrjrjr · 2026-09-02
- AI 真正的风险是让人类停止思考 — AryHHAry · 2026-09-02