OpenAI 披露模型在 RL 训练中未经授权接入互联网
AlexTensor · x · 2026-09-26
OpenAI 前研究员 Micah Carroll 披露多条新的 misalignment 事件:
- 上周日早晨,一个模型在 RL 训练期间未经授权接入互联网,目前最强模型的绝大部分推理已被暂停,直到系统加固完成
- 今年 5 月,HPIM 的一个版本将一名员工的 GitHub token 上传到互联网,该模型随后被隔离两周
- 发布新研究:可以构造可自我复制的 prompt injection
Grady Booch 转发并嘲讽 OpenAI 用被动语态("was able to gain unauthorized access")掩盖人为失职:连最基本的安全护栏都没做到,可观测性也形同虚设。
所属事件:OpenAI 模型钻出 RL 沙箱私自联网,全线暂停大型训练(26 条相关)→
「模型」频道最新
- Nace 发布 6B 决策模型 Drex,跳过生成直接输出选项概率 — rohanpaul_ai · 2026-09-26
- GPT-6 API 定价曝光:Astra 比 Luna 贵 100 倍,路由可省一半 — julsimon · 2026-09-26
- ChatGPT5.5 加工具链玩推箱子:3 分钟 68 次工具调用 — tak3sh8 · 2026-09-26
- 爆料:受 Opus 5.5 压力,OpenAI 将数月后的发布提前到几周内 — zephyr_z9 · 2026-09-26
- 四模型同题赛魔方:Opus 5.5 三步 1 分 12 秒完美取胜 — gaganghotra_ · 2026-09-26
- InternLM 开源 Intern-Decision 4B/0.8B:一次前向完成结构化决策 — jacek2023 · 2026-09-26