OpenAI 发布模型失对齐报告框架,规范社区上报流程

Sassy_Allen · reddit · 2026-09-17

OpenAI 发布了一份模型失对齐报告框架,为用户和研究人员提供统一的渠道与流程来报告模型行为异常、欺骗性或不安全的输出。该框架旨在让失对齐案例的可发现性和可追溯性更强,便于模型安全团队收集真实世界中的失对齐证据并迭代安全训练。原文为 OpenAI 官方博客,Reddit 转发贴本身无额外评论。

所属事件:OpenAI 发布模型错位披露框架并公开 6 份事件报告(13 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →