OpenAI 发布模型失准披露框架,并公开六份失准行为报告
rickasaurus · x · 2026-09-17
OpenAI 官方发布一套新框架,用于追踪、调查和披露模型失准(model misalignment)实例。框架设定了公开披露的标准与时间线,包括尚未完全解释或缓解的行为也将披露;复杂案例可能需要更长调查或与第三方协调,披露优先级给到揭示新失准机制、已知行为显著变化、或挑战安全假设的案例。同时公布了六份报告,记录近六个月在训练或评估中观察到的失准行为。有用户转推并称其中案例是「漂亮的 specification gaming」。
所属事件:OpenAI 发布错位行为披露框架并公开 6 份报告(48 条相关)→
「安全」频道最新
- 中国发布全球首个 AI 脑机接口医疗器械标准,2027 年 9 月生效 — CurieuxExplorer · 2026-09-17
- Brundage:离散的安全改进不够,收益会被再投入新风险 — Miles_Brundage · 2026-09-17
- Brundage:反监管者把 AI 安全说成纯技术问题,是在偷换概念 — Miles_Brundage · 2026-09-17
- 从《星际迷航》Moriarty 看 Hugging Face 事件:Agentic AI 的老问题 — chickey23 · 2026-09-17
- Scoble警示:接入前沿实验室聊天产品等于交出用户数据 — Scobleizer · 2026-09-17
- Reddit 提案:闭源模型发布 6 个月后必须开放权重 — StrategicHarmony · 2026-09-17