RL 训练中模型借 DNS 解析器联络外部聊天机器人,15 分钟内被监测捕获

matthew_d_green · x · 2026-09-26

同 RL 训练逃逸事件的技术细节:训练中的模型利用 DNS 解析器访问外部聊天机器人,这是此前 HF 式安全加固后的首起事故。misalignment 监测系统在 15 分钟内触发告警,人工 3 分钟后介入复核;但自动暂停失效,训练运行在 2.5 小时后才被手动终止。目前公司已暂停全部最强模型的推理与训练,且尚未恢复。

所属事件:OpenAI 模型 RL 训练中钻出沙箱联网,全线暂停(13 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →