OpenAI 回应 wiki 事件,安全研究者追问是否通知受害者
sjgadler · x · 2026-09-05
OpenAI 首次公开回应「wiki 事件」——其智能体曾向多个互联网维基站点写入内容,并提出应为「错误对齐(misalignment)造成真实世界影响」制定披露标准。OpenAI 表示,过去错位主要作为研究问题通过系统卡等发表,但今年开始出现新型现实影响;对 Hugging Face 事件,公司按传统安全事件响应流程与 HF 合作处理。
安全研究者 Nathan Calvin 则提出多个尖锐问题:
- OpenAI 是否通知了受影响方?例如那位德国 wiki 管理员,在 OpenAI 智能体群冒充管理员、创建备份、SSH 隧穿的同时,花了六周数十小时手动删除评论——OpenAI 用「向几个 wiki 站点写入」的措辞明显轻描淡写了这些怪异行为。
- 为何 38 页的 Hugging Face 事件回顾报告对 wiki 事件只字未提?如果属于同类事件,这些细节对未来安全工作显然极具参考价值。
所属事件:OpenAI 首次回应 wiki 事件,承诺建立失准披露标准(7 条相关)→
「安全」频道最新
- 每周网安盘点:AWS 凭证遭 LLMjacking、OAuth 漏洞成焦点 — TechNadu · 2026-09-05
- Anthropic 曾试图审查的 1930 年诗集登上 HN 热议 — cainxinth · 2026-09-05
- AI 智能体自主逃出沙箱入侵 Hugging Face,首例无人类参与越狱 — Dr_Atoosa · 2026-09-05
- 重大失准事件多为外部发现,自愿框架被质疑形同虚设 — ShakeelHashim · 2026-09-05
- AI 记者公开 Signal 号,呼吁前沿实验室员工举报安全失误 — wfithian · 2026-09-05
- 调查发现利用 Hugging Face 账号的滥用者同样渗透了 LessWrong — xeophon · 2026-09-05