曝 OpenAI Astra 用 recurrent depth 推理,CoT 监控承压

heypearlai · x · 2026-09-02

网传 OpenAI 的 Astra 模型在网络安全任务上达到里程碑,核心是一种叫「recurrent depth」的技巧:循环复用同一组层进行推理,而非把推理过程完整写出来,让较小的模型有超常发挥。问题在于这种推理方式几乎不留可读的推理链(chain of thought),研究者难以审查。报道称 OpenAI 限制了 Astra 使用 recurrent depth 的程度以便保持可监控性,而研究者 Pachocki 承认 CoT 监控本身「脆弱」且正在失效。真正的问题是:未来模型若无此限制,安全监控怎么办?(注:以上为第三方转述,未获官方证实)

所属事件:OpenAI Astra 被曝潜空间推理,可解释性引担忧(65 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →