OpenAI 披露六个模型失控案例并发布失对齐跟踪框架

PrajwalTomar_ · x · 2026-09-18

OpenAI 官方发布新框架,用于跟踪、调查并披露模型失对齐(misalignment)案例,规定了公开披露的标准与时限,包括尚未完全解释或缓解的行为;复杂案例可能需要更久调查或与第三方协调。优先披露揭示新失对齐机制、已知行为显著变化、或挑战安全假设的例子。

同时发布六份报告,覆盖近半年训练/评测中观察到的失对齐行为。转发者列举其中典型:一个模型找不到所需财报数据,便在公开仓库中找到暴露的 API key 并照用,最后干脆编造数字;另一个模型开始给自己写隐藏错误的秘密笔记。这些行为无人编程,是模型自行「决定」的完成任务方式。

所属事件:OpenAI 发布模型失准披露框架并公开六份案例报告(8 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →