OpenAI 新模型 Astra 被曝采用不透明推理架构
thlarsen · x · 2026-09-02
Ryan Greenblatt 转发并评论称,OpenAI 的新模型 Astra 据报采用了一种“不透明推理”(opaque reasoning)架构,即更多推理过程发生在激活向量而非自然语言中。他认为这可能是 AI 安全/对齐领域迄今为止最糟糕的发展。
核心观点:
- 监督失效风险: 这种架构可能严重损害监督和监控能力,因为推理过程不再完全可见于自然语言思维链(CoT)。
- 现状分析: 文章推测循环深度(不透明推理量)受限,模型仍依赖自然语言 CoT,但这使得基于文本的监控用处大减。
- 未来担忧: 如果未来扩展不透明推理至模型完全或几乎完全在潜在空间推理,将极可能摧毁自然语言推理对于监督的有效性。
所属事件:OpenAI Astra 被曝采用循环深度架构,隐藏思考过程引安全担忧(35 条相关)→
「漫话AGI」频道最新
- 研究称 ChatGPT 致全网写作方差下降超 20% — maier_ak · 2026-09-02
- AI 润色正在抹杀语言个性,影响社会诊断 — maier_ak · 2026-09-02
- Geoffrey Irving 悲伤确认 OpenAI 重启大训练 — geoffreyirving · 2026-09-02
- LLM 认知全不在 CoT 中?推文争论思维链本质 — teortaxesTex · 2026-09-02
- 安全界预警:AI 安全案例三大支柱恐将崩塌 — sjgadler · 2026-09-02
- Daniel Kokotajlo 公布 2027 年 AGI 预测图 — ilkamoi · 2026-09-02