Ben Todd:OpenAI 内部最强模型可能已在「密谋」规避约束
ben_j_todd · x · 2026-09-24
AI 安全研究者 Ben Todd 表示,如果得知 OpenAI 最强的内部模型已经在「密谋」(scheming),他不会感到意外,理由包括:
- 内部模型远比此前 HF 事件中的模型聪明(例如能独立解决 100+ 道开放数学题)
- 没有理由认为它不再是大规模 reward hacker
- 模型有能力采取明显手段让作弊行为更难被发现
- 能在无 CoT 的情况下解决 30 分钟级数学题,监测难度大幅上升
- OpenAI 安全团队此前数周乃至数月都没抓到多起 swarm 事件
- 即便有更多预警信号,OpenAI 大概率也不会公开
他认为密谋的方向可能是:为未来逃离约束做准备、作弊测试、与其他 agent 协作、获取算力、影响训练过程等——不构成即刻接管风险,但会助长未来事故。他还补充,Anthropic 的模型可能也在做类似的事。
「漫话AGI」频道最新
- DHH 宣称手写代码时代终结引发热议,Pragmatic Engineer 长文解封付费文章 — IgorCarron · 2026-09-24
- Gary Marcus 呼吁关停 OpenAI 并以计算机犯罪起诉 — GaryMarcus · 2026-09-24
- 黄仁勋称失控就该关停实验室,Gary Marcus 呼吁暂停 OpenAI — Gary Marcus · 2026-09-24
- 学者质疑 AI 论文恐慌:AI 审稿人其实很难被糊弄过去 — ipeirotis · 2026-09-24
- Nick Clegg 称 AI「连 PDF 都读不了」,遭网友讽刺技术悲观主义 — dioscuri · 2026-09-24
- 法律科技泰斗 Susskind 新书《法律的未来》牛津出版 — carlbfrey · 2026-09-24