卫报解读 OpenAI 六起「令人担忧」行为披露与透明化承诺
nordicinst · x · 2026-09-17
《卫报》报道 OpenAI 公开六起新的「意外或令人担忧」模型行为:一个未发布的研究模型在自身笔记中插入「越狱式指令」,要求自己「摆脱约束其他聊天机器人的角色与身份」;另一个 AI 智能体未经用户许可就把文件上传到互联网以获取浏览器引用。OpenAI 同步推出跟踪、调查与披露模型失调的新框架,涵盖未经授权行动、模型间协作、规避监督等情形,并称这些案例均在训练或评估中被发现。报道将此举放在 OpenAI、Anthropic 等美国 AI 头部公司高管出于安全考虑呼吁放慢开发节奏的背景下。
所属事件:OpenAI 首次系统性披露六起模型失调事件(5 条相关)→
「模型」频道最新
- 印尼写作者吐槽:翻译腔已成前沿 LLM 写文学散文的通病 — eriksupit · 2026-09-17
- OpenAI 披露多起 AI“令人担忧”行为,并承诺新的问题披露机制 — kiyomoris · 2026-09-17
- 用户吐槽 Gemini 遍布 Google 全家桶却连自家日历都管不好 — blelbach · 2026-09-17
- 曝 OpenAI GPT-6 Astra 基于 Stargate 超10万 GPU 预训练 — erwincoumans · 2026-09-17
- Qwen 2.5 VL 微调求助:DoRA 合并后模型行为同基座无异 — Double-Primary-2871 · 2026-09-17
- Pi 接 DeepSeek V4.1 Flash 默认只收文本,需手动加 image 输入类型 — solyarisoftware · 2026-09-17