传 OpenAI 新技术削弱 CoT 可监控性,Bengio 等联署论文作者回应
GaryMarcus · x · 2026-09-03
据 The Information 报道,OpenAI 新技术降低了思维链(CoT)的可监控性,Gary Marcus 紧急呼吁大家重读 2025 年论文《Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety》(作者含 Yoshua Bengio、Beth Barnes、Adrià Garriga-Alonso、Neel Nanda 等)。论文核心观点:CoT 监控与其他已知 AI 监督手段一样并不完美,会漏掉部分不当行为,但前景可观,值得在现有安全措施之外持续投入研究。论文原作者之一 Tomasz Korbak 转发表态「仍完全坚持论文结论:CoT 可监控性脆弱但值得保全、且有可能保全」。
「安全」频道最新
- Palantir CEO Karp 谈 AI 监管:自称「不高兴的民主党人」 — felpix_ · 2026-09-03
- 可变深度 Transformer 引发安全争论:模糊规范会引发逐底竞赛 — Turn_Trout · 2026-09-03
- 纽约州议员呼吁公众应有 AI 发展话语权,获 OpenAI 研究员声援 — jachiam0 · 2026-09-03
- 模型注入攻击 POC:微调模型可带隐藏触发器绕过安全护栏 — Ok-Challenge-7810 · 2026-09-03
- Agent 上线前该配好哪些安全措施?从业者实用求讨论 — Bubbly_Working_6908 · 2026-09-03
- 研究者警告:拆除网络安全护栏或让 AI 判断力全面失控 — andreamichi · 2026-09-03