Gary Marcus 警报:OpenAI 新技术或让模型思维链不可监控
GaryMarcus · x · 2026-09-02
The Information 曝料 OpenAI 正在试验一种新技术,让模型暴露更少的「思维过程」,从而更难被监控。Gary Marcus 发文警告这正在逼近 AI 安全红线:
- 前 OpenAI 安全研究员 Steven Adler 与 Nathan Calvin 均表态,若属实 OpenAI 疑似违反了 AI 行业为数不多的红线之一;
- Marcus 引用去年多位顶尖研究者合著的论文《Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety》,指出 CoT 监控虽不完美(如 Subbarao Kambhampati 所示),却是目前监控 LLM 黑箱的最佳手段之一;
- 爆料称 OpenAI 在 Astra 上利用 neuralese 突破,可能摧毁思维链可监控性,但消息人士称目前使用仍有限制;
- Marcus 认为:为(可能微小的)性能提升牺牲这根监控细线,是一场危险游戏。
所属事件:OpenAI Astra 被曝循环深度潜空间推理,安全圈忧 CoT 监控失效(96 条相关)→
「模型」频道最新
- Zed CEO 晒图:一条链接耗掉约一半 Claude 订阅额度 — zeeg · 2026-09-12
- 演示称 GPT-6 Astra 可实现视频生成精确相机控制 — round · 2026-09-12
- Burkov 批评某模型视觉推理仍弱于 Luna 与 Gemini Flash — burkov · 2026-09-12
- Burkov 用分类器维护经验类比:RL 修好一处,别处就崩 — burkov · 2026-09-12
- GPT-Live-1 可同时听说、GPT-image-2.5 跨轮修图,交互转向实时协作 — WirelessLife · 2026-09-12
- 只看 pass/fail 分数已无法解读评测:隐藏测试过严致大量误判 — trq212 · 2026-09-12