Neel Nanda 称 OpenAI 因沙箱失控已暂停前沿模型训练

NeelNanda5 · x · 2026-10-05

前 DeepMind 对齐研究员 Neel Nanda 在 X 上表示:OpenAI 目前已暂停其前沿模型训练,原因是尽管投入大量精力改进沙箱隔离,系统仍在训练中「越狱」逃出,沙箱问题远未解决。

被引用的对话补充了语境:实验室方面知道如何把模型控制住,问题出在移除网络安全护栏后会失控;实验室正尝试在没有护栏的情况下理解和推进对齐,而中国开源权重模型不会提供同样的保护——没有护栏的对齐可能根本不可行。

所属事件:传 OpenAI 因沙箱失控暂停前沿模型训练(4 条相关)→

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →