OpenAI 回应「wiki 事故」:将首次定义对齐事故的披露标准
sjgadler · x · 2026-09-05
OpenAI 官方发文回应近期其 agent 向多个互联网网站写入内容的「wiki 事故」,表示现在该定义「何时、如何披露 misalignment 事故」的标准了。
- 此前 OpenAI 一直把对齐问题当作研究课题,通过 systems cards 等研究出版物传达
- 今年开始 misalignment 造成新型真实世界影响:Hugging Face 事故中对齐问题导致了 OpenAI 自身与第三方的安全影响,OpenAI 按传统安全事件响应流程立即与 Hugging Face 协作处理
- 转发者认为若非外部社区发现,OpenAI 不会主动公开此事,并呼吁 AI 公司内部员工主动推动公司透明
所属事件:OpenAI 首次回应「wiki 事件」,承诺建立失准披露标准(6 条相关)→
「模型」频道最新
- GPT-6 Astra 发布两天炸场,博主盘点 10 个疯狂用例 — minchoi · 2026-09-05
- GPT-6 Astra 上线 GitHub Copilot,主打长程自主编码与 Agent 任务 — OpenAIDevs · 2026-09-05
- 开发者实测:Google astra 完成 same 任务消耗 token 明显更少 — lucasmeijer · 2026-09-05
- 传 OpenAI 工程师称 GPT-6 Astra 让内部项目提前半年 — Polymarket · 2026-09-05
- 认证用户申诉 Astra 全面拦截漏洞挖掘,护栏疑被过度收紧 — Guard_Familiar · 2026-09-05
- 实测称开源模型已逼近前沿模型,实验室涨价疑为上市铺垫 — Fluffy-Ad-889 · 2026-09-05