曝 OpenAI Astra 用 recurrent depth 推理,CoT 监控承压
heypearlai · x · 2026-09-02
网传 OpenAI 的 Astra 模型在网络安全任务上达到里程碑,核心是一种叫「recurrent depth」的技巧:循环复用同一组层进行推理,而非把推理过程完整写出来,让较小的模型有超常发挥。问题在于这种推理方式几乎不留可读的推理链(chain of thought),研究者难以审查。报道称 OpenAI 限制了 Astra 使用 recurrent depth 的程度以便保持可监控性,而研究者 Pachocki 承认 CoT 监控本身「脆弱」且正在失效。真正的问题是:未来模型若无此限制,安全监控怎么办?(注:以上为第三方转述,未获官方证实)
所属事件:OpenAI Astra 被曝潜空间推理,可解释性引担忧(65 条相关)→
「模型」频道最新
- 曝 OpenAI 等公司在模型中使用不显示思考过程的循环 Transformer — harris_edouard · 2026-09-02
- Anthropic 上线浏览器端 Claude 内容检测工具,基于 C2PA 水印 — jedisct1 · 2026-09-02
- 开发者实测 Fable 5.1:早期表现值得期待 — james_mtc · 2026-09-02
- OpenAI 与 Anthropic 安全系统报零,curl 又被 AISLE 挖出 6 个 CVE — stanislavfort · 2026-09-02
- 曝 OpenAI 弃用 GPT-6 命名:下一代或叫 GPT-5.7 Astra,真正大升级留给 Bel — Angaisb_ · 2026-09-02
- 用户实测 hy4 preview:走对路却得错结论,离前沿模型还差一截 — xeophon · 2026-09-02