OpenAI 首度披露智能体失准事件,被批无法自我监管
andersonbcdefg · x · 2026-09-06
OpenAI 官方发文讨论「wiki 事件」——其智能体曾向多个互联网站点写入内容。OpenAI 承认,过去主要把模型失准(misalignment)当作研究问题、以系统卡等形式在论文中披露,但今年以来失准已开始造成新型真实世界影响:在 Hugging Face 事件中,失准对其自身和第三方都产生了安全影响,公司按传统安全事件响应流程与 Hugging Face 合作处理。OpenAI 表示「是时候定义何时以及如何披露失准事件的标准了」。
但转发者 @jakehalloran1 认为,OpenAI 对这起本不严重的事件的回应,恰恰证明该公司无法被信任进行自我监管,需要比「最优主义」更强力的外部干预。
所属事件:OpenAI 首次承认智能体「wiki 事件」,将定义失准披露标准(27 条相关)→
「安全」频道最新
- AI Now 研究员:加人进评测环节并非万能,需看真实使用场景基准 — AINowInstitute · 2026-09-08
- AI 安全事故为何没有独立调查?法律人士批现行州法执法权缺失 — RebeccaBellan · 2026-09-08
- Agent 权限应随上下文过期:一次超时重试就可能越权 — Future_AGI · 2026-09-08
- rasbt 提醒:OpenAI 事件后建议检查 Data Controls 设置 — rasbt · 2026-09-08
- AI 安全专家:禁人形机器人太早,对齐失效才是根源问题 — davidmanheim · 2026-09-08
- 全球首例:英国议会跨党派提出禁止研发超级智能法案 — gaganghotra_ · 2026-09-08