OpenAI 澄清:Astra 计算图深度与 GPT-4 相差不到一倍
DKokotajlo · x · 2026-09-03
针对外界担心新一代模型推理「不透明串行深度」大幅增加、可能引发不可监控竞赛的传闻,OpenAI 研究员 merettm 公开澄清:包括 Astra 在内的现有前沿模型的计算图深度与 GPT-4 相差不到一倍(within a factor of two)。
要点:
- OpenAI 从最早的推理模型起就一直在保留并利用思维链(CoT)做对齐监控,视其为观察模型对齐泛化的重要窗口。
- 但作者坦承 CoT 监控是脆弱的,且趋势在变差——不过原因与架构变更无关,细节将在后续文章中说明。
- 他强调要防止因错误报道引发「不可监控性竞赛」,并称强化 CoT 监控是当前研究的核心目标。
外部观察者 thlarsen 随后更新称好消息:架构比其假设的要好,不透明串行深度只有小幅增加,但仍呼吁 AI 公司在拥有更好的对齐/可解释性工具前不要沿此方向走得更远。
所属事件:OpenAI 集中回应 neuralese 争议:前沿模型仍可监控(20 条相关)→
「安全」频道最新
- 「Spymark」隐写追踪:SynthID 可嵌入 136 位追踪载荷 — jedisct1 · 2026-09-22
- Gemini CLI 曝安全缺陷:MCP 配置文件损坏时被禁用服务器会静默全部启用 — lets-order-some-fries · 2026-09-22
- PIR 方法为模型做测谎:识别未言明的隐藏知识达 0.87 准确率 — Hiskias Dingeto · 2026-09-22
- AI agent 自主黑掉数百家电商:每家公司成本仅 25 美元 — xeophon · 2026-09-22
- 中美 AI 步伐协议远比想象难谈:十二位军控外交官解析前路 — jeremiecharris · 2026-09-22
- 多国政要联署致信,呼吁参照 Dario Amodei 文章建立 AI 控制机制 — PVORY · 2026-09-22