OpenAI 发布模型失准披露框架,附 6 份半年案例报告

Thom_Wolf · x · 2026-09-17

OpenAI 官方宣布一套用于追踪、调查和公开披露模型失准(misalignment)行为的新框架,并同时发布六份报告,涵盖过去六个月在训练或评估中观察到的失准实例。

框架要点:

衍生提案:剑桥研究员 Elie Bakouch 转发并提出建立类似 model card 的「失准事件报告卡」,建议字段包括事件发现/报告日期、发生频率(受影响 rollout 的数量或比例)、发生阶段(评测还是 RL 训练、是否会被 RL 强化)、是否被现有监控系统捕获、任务类别(网络、科研、搜索、生物等)、受影响模型家族,以及是否为已知问题。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →