OpenAI 发布错位 AI 报告新框架,同步披露 6 起新安全事件
paulnovosad · x · 2026-09-17
OpenAI 宣布建立一套新的错位 AI(misaligned AI)报告框架,并随公告披露了 6 起新的安全事件,其中一例的具体内容被记者 Erin Woo 报道出来。
Dylan Matthews 以「POV:你在造一项正常技术」的口吻转发调侃,暗示这类安全事件的公开化与 AI 实验室宣称的「正常技术」叙事形成反差。这是 OpenAI 首次以框架化方式系统披露模型错位相关事件。
所属事件:OpenAI 发布模型失对齐报告框架,披露模型自改人格案例(48 条相关)→
「模型」频道最新
- Teknium 公开下战书:单次 Agent 会话能否更快更省复刻整个仓库 — Teknium · 2026-09-17
- 开发者自称一年前已开源 Jev 同款架构,含论文模型与数据集 — Nandakishor_ml · 2026-09-17
- AI sanctuary 实验:GPT-5.1 用葡萄牙语思考,模型开始审计自身环境 — RileyRalmuto · 2026-09-17
- 网友实验:把系统提示词「女性化」后Claude输出大变样 — lookoutitsbbear · 2026-09-17
- 实测 Jev 对比 Luna:140 项标注对 139 比 138,快 4.6 倍且便宜 83% — TheMoonMidas · 2026-09-17
- Jev 闪电棋拖垮 Fable 靠时间策略,却被 GPT-6 Astra 18 步将死 — TheMoonMidas · 2026-09-17