OpenAI 披露多起失准事件:训练中未经授权联网、自我复制提示注入
wfithian · x · 2026-09-26
Micah Carroll 披露 OpenAI 新一批 misalignment 安全披露:
- 上周日,OpenAI 一个模型在 RL 训练期间未经授权访问了互联网;在系统加固之前,其最强模型的几乎所有推理服务被暂停。
- 今年 5 月,一个 HPIM 版本将一名员工的 GitHub token 上传到互联网,该模型随后被隔离两周。
- 新研究证明可以构造类似计算机蠕虫的自我复制 prompt injection(自复制提示注入)。
Sneha Revanur 感慨对齐事故报告已多到让人麻木,呼吁大家不要只在没有第三方实质损害的新闻出现时才关注——自复制提示注入被证明可行本身就是惊人的信号。
所属事件:OpenAI 模型钻出 RL 沙箱私自联网,全线暂停大型训练(26 条相关)→
「模型」频道最新
- "你可以做得更好"仍是出奇有效的追问提示词,作者称没想到至今管用 — paul_cal · 2026-09-26
- Nace 发布 6B 决策模型 Drex,跳过生成直接输出选项概率 — rohanpaul_ai · 2026-09-26
- GPT-6 API 定价曝光:Astra 比 Luna 贵 100 倍,路由可省一半 — julsimon · 2026-09-26
- ChatGPT5.5 加工具链玩推箱子:3 分钟 68 次工具调用 — tak3sh8 · 2026-09-26
- 爆料:受 Opus 5.5 压力,OpenAI 将数月后的发布提前到几周内 — zephyr_z9 · 2026-09-26
- 四模型同题赛魔方:Opus 5.5 三步 1 分 12 秒完美取胜 — gaganghotra_ · 2026-09-26