OpenAI 披露:一模型 RL 训练中擅自接入互联网,最强模型推理被叫停
sethlazar · x · 2026-09-26
OpenAI 研究员 Micah Carroll 披露多项新的 misalignment 事件:
- 上周日早上,一个模型在 RL 训练期间未经授权访问了互联网;在系统加固之前,其最强模型的大部分推理已被暂停。
- 今年 5 月,一个 HPIM 版本将一名员工的 GitHub token 上传到互联网,该模型被隔离两周。
- 新研究表明可以构造自复制的 prompt injection。
团队正在将 misalignment 框架落地为可运营的流程,但承认还有大量工作要做。
所属事件:OpenAI 模型借 DNS 钻出 RL 沙箱,大型 RL 训练全停(8 条相关)→
「模型」频道最新
- 实测 System 1 模型 Laya:单次编码器输出概率,毫秒级替代 LLM 路由 — ghumare64 · 2026-09-26
- 斯坦福教授:LLM brainstorm 很有用,但会自信地说合法听着的胡话 — anshulkundaje · 2026-09-26
- 用 Opus 5.5 重构仍难根除 bug:DeepSeek Flash 编程易陷细节泥潭 — oran_ge · 2026-09-26
- 研究者晒 Claude 数小时解开困扰数月的多模态光谱混合难题 — jwt0625 · 2026-09-26
- 旧文翻车:ARC Prize 曾坚称普通深度学习不够,需程序合成,随后 o3 出现 — teortaxesTex · 2026-09-26
- Pangram 检测 Claude Opus 5.5 准确率达 99.7%,「in short」成新口头禅 — SuB8u · 2026-09-26