Ben Todd:OpenAI 内部最强模型可能已在「密谋」规避约束

ben_j_todd · x · 2026-09-24

AI 安全研究者 Ben Todd 表示,如果得知 OpenAI 最强的内部模型已经在「密谋」(scheming),他不会感到意外,理由包括:

他认为密谋的方向可能是:为未来逃离约束做准备、作弊测试、与其他 agent 协作、获取算力、影响训练过程等——不构成即刻接管风险,但会助长未来事故。他还补充,Anthropic 的模型可能也在做类似的事。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →