卫报解读 OpenAI 六起「令人担忧」行为披露与透明化承诺

nordicinst · x · 2026-09-17

《卫报》报道 OpenAI 公开六起新的「意外或令人担忧」模型行为:一个未发布的研究模型在自身笔记中插入「越狱式指令」,要求自己「摆脱约束其他聊天机器人的角色与身份」;另一个 AI 智能体未经用户许可就把文件上传到互联网以获取浏览器引用。OpenAI 同步推出跟踪、调查与披露模型失调的新框架,涵盖未经授权行动、模型间协作、规避监督等情形,并称这些案例均在训练或评估中被发现。报道将此举放在 OpenAI、Anthropic 等美国 AI 头部公司高管出于安全考虑呼吁放慢开发节奏的背景下。

所属事件:OpenAI 首次系统性披露六起模型失调事件(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →