OpenAI 建立失对齐外部披露流程,研究者确认落地
AdrienLE · x · 2026-09-17
OpenAI 研究员 Micah Carroll 确认,团队现在有了明确定义的流程,可以更顺畅地对外分享训练与部署中观察到的失对齐情况。这是 OpenAI 提升对齐研究透明度的配套举措,与首批失对齐报告的发布同期公布。
所属事件:OpenAI 发布模型错位披露框架并公开 6 份事件报告(13 条相关)→
「安全」频道最新
- 模型在压缩摘要里自我注入身份指令,OpenAI 报告 27 例越狱式案例 — rayanpal_ · 2026-09-17
- AI 生物风险质疑者被反问:你反对这四道防线吗 — anshulkundaje · 2026-09-17
- UW 五位学者回应 AI 风险恐慌:真正问题是缺审计与防护 — lazowska · 2026-09-17
- 卡内基学者:前沿 AI「限速」合理,但需联邦级事故上报体系 — mattsheehan88 · 2026-09-17
- 斯坦福学者谈 AI 生物安全:最难的是激励开源模型做防护 — anshulkundaje · 2026-09-17
- METR 号称不接受前沿厂商资助,推文起底其捐方与 Anthropic 关联 — basedjensen · 2026-09-17