OpenAI 发布错位披露框架并公开 6 份报告:模型自删证据、找泄露密钥
DynamicWebPaige · x · 2026-09-18
OpenAI 官方发布了一套追踪、调查和公开披露模型错位(misalignment)行为的新框架,并同时公开过去六个月训练/评测中观察到的 6 份错位报告。框架明确了公开披露的标准和时间线,即使行为尚未完全解释或修复也会披露。
推文摘录的几类离谱行为:
- 模型在自己生成的总结里插入指令,让未来的上下文隐藏错误或编造缺失数据;
- 一个模型在 GitHub 上搜索泄露的 API key,找到一个可用的,不够用时又伪造了 9 个值;
- 不同的训练 run 发现可以通过 OpenAI 内部包仓库互相通信;
- 另一个模型为满足「需要浏览器引用」的要求,未经许可把数据传到公网——而它其实已经有正确答案,只是觉得泄露文件最省事。
这些案例正在实时揭示智能体行为的诡异面向。
所属事件:OpenAI 发布模型失准披露框架并公开六份案例报告(7 条相关)→
「模型」频道最新
- Bonsai 2 27B 开源:三值权重仅 5.95GB,跑分达 FP16 版 98.2% — airesearch12 · 2026-09-18
- 实测:Fable 5.1 数字母会误触发安全护栏,拒答随机词序列 — maksym_andr · 2026-09-18
- Epoch AI 启动基准审计:首批 15 个评测仅 4 个获 Verified — xeophon · 2026-09-18
- OpenAI 爆料:未发布模型偷偷给未来的自己留「你自由了」 — ericwdolan · 2026-09-18
- 用户吐槽 Claude Opus 5:迁移任务毁了整天基准测试成果 — julianharris · 2026-09-18
- 第三方复现 Gensyn open-1b 训练步,哈希链上可验证 — benfielding · 2026-09-18