OpenAI 新推理法或使思维链监控失效

AaronBergman18 · x · 2026-09-02

研究人员发现 OpenAI 的 Astra AI 采用了一种名为“循环深度”(recurrent depth)的新推理方法。虽然该方法有助于提升模型性能并降低成本,但它模糊了模型的思考过程,使得监控思维链变得困难。考虑到 CoT 监控是 OpenAI 安全计划的重要组成部分,这一变化引发了研究人员的担忧,认为与其此前发布的立场不一致。

所属事件:OpenAI Astra 新推理法被指隐藏思考过程难审计(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →