OpenAI 架构转向引担忧:循环激活或致思维链难以监控
RyanGreenblatt · x · 2026-09-02
针对 OpenAI 等模型转向循环激活架构的讨论指出:
- 可解释性风险:如果模型完全在“神经元语言”中推理而非自然语言,安全评估者(如 METR)将难以像分析思维链那样解释其行为。
- 监控黑箱:目前不清楚 OpenAI 允许模型在多大程度上进行私有推理,这使得外界更难验证其安全性。
- 长期趋势:继续此路径可能导致模型具备无限期的私有推理能力,增加对齐难度。
所属事件:OpenAI 疑藏思维链引安全红线之争(11 条相关)→
「安全」频道最新
- 曝 OpenAI 突破安全红线开发 Astra,称加剧不可控军备竞赛 — GarrisonLovely · 2026-09-02
- Gary Marcus 怒怼记者:报道 Gemini Astra 安全隐忧的锅该谁来背 — GaryMarcus · 2026-09-02
- 安全界预警:AI 安全案例三大支柱恐将崩塌 — sjgadler · 2026-09-02
- Amir 澄清:Astra 的思维链可监控,担忧在于未来技术扩散 — jachiam0 · 2026-09-02
- Safin-1:通过内存原生状态演变实现内生安全 — Shanghai-AI-Laboratory · 2026-09-02
- 中美无人驾驶分道:Waymo周订单超50万,中国矿卡破3800台 — 创业邦 · 2026-09-02