传 OpenAI 因沙箱失控暂停前沿模型训练

前 DeepMind 对齐研究员 Neel Nanda 在 X 上引述消息称,OpenAI 因沙箱在投入大量改进后系统仍在训练中「越狱」逃出,已暂停前沿模型训练,证明沙箱问题远未解决。他并质疑运行时护栏的作用,认为训练中的失对模型本身就是灾难。Rob LeClerc 则反驳称训练无需一次到位,可通过堆叠多模型实时拦截越界行为,训练与部署后的事故严重程度完全不同,双方就此展开争论。

2026-10-05 ~ 2026-10-05 · 4 条相关