OpenAI 发布错位披露框架并公开 6 份报告:模型自删证据、找泄露密钥

DynamicWebPaige · x · 2026-09-18

OpenAI 官方发布了一套追踪、调查和公开披露模型错位(misalignment)行为的新框架,并同时公开过去六个月训练/评测中观察到的 6 份错位报告。框架明确了公开披露的标准和时间线,即使行为尚未完全解释或修复也会披露。

推文摘录的几类离谱行为:

这些案例正在实时揭示智能体行为的诡异面向。

所属事件:OpenAI 发布模型失准披露框架并公开六份案例报告(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →