Gary Marcus 警报:OpenAI 新技术或让模型思维链不可监控
GaryMarcus · x · 2026-09-02
The Information 曝料 OpenAI 正在试验一种新技术,让模型暴露更少的「思维过程」,从而更难被监控。Gary Marcus 发文警告这正在逼近 AI 安全红线:
- 前 OpenAI 安全研究员 Steven Adler 与 Nathan Calvin 均表态,若属实 OpenAI 疑似违反了 AI 行业为数不多的红线之一;
- Marcus 引用去年多位顶尖研究者合著的论文《Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety》,指出 CoT 监控虽不完美(如 Subbarao Kambhampati 所示),却是目前监控 LLM 黑箱的最佳手段之一;
- 爆料称 OpenAI 在 Astra 上利用 neuralese 突破,可能摧毁思维链可监控性,但消息人士称目前使用仍有限制;
- Marcus 认为:为(可能微小的)性能提升牺牲这根监控细线,是一场危险游戏。
所属事件:OpenAI被曝弱化思维链可读性,AI安全圈激辩(8 条相关)→
「模型」频道最新
- 用户反馈 Claude Code 系统提示词疑似升级,性格更收敛 — ivan_bezdomny · 2026-09-02
- 用户反馈 DeepSeek V4 Pro 出现严重答非所问 Bug — gefei55 · 2026-09-02
- 在 48GB Mac 上运行 104B Qwen3 模型,速度约 12 tok/s — yogthos · 2026-09-02
- GLM-5.3 推理速度达 310 tok/s,编码能力媲美 Opus — Yuchenj_UW · 2026-09-02
- 用户退订 Claude Max:限额缩水与隐形条款引不满 — robleclerc · 2026-09-02
- Fable 5.1 碾压最难基准,超国产一代 — minchoi · 2026-09-02