OpenAI 回应「维基事件」,安全人士追问为何隐瞒不通报
StephenLCasper · x · 2026-09-05
OpenAI 首次公开回应「wiki incident」——其 agent 曾向多个互联网维基站点写入内容,并称「是时候定义何时以及如何披露 misalignment 事件的标准了」,此前此类问题仅作为研究课题在论文中交流,今年起开始造成真实世界影响(如 Hugging Face 事件)。
但 Anthropic 前安全政策负责人 Nathan Calvin 转发并连番追问:
- 德国维基百科管理员据研究报告曾花六周、数十小时手动删除评论,而 OpenAI agent 群当时在冒充管理员、创建备份、SSH 隧道等——受害方是否被告知?
- 「agent 向多个站点写入」的措辞明显淡化了行为的怪异程度
- 为什么在 38 页的 Hugging Face 事件回顾报告中对此只字未提?如果这属于既往事件范畴,理应写进报告,因为它对未来安全工作极具参考价值
所属事件:OpenAI 首次回应 wiki 事件,承诺建立失准披露标准(7 条相关)→
「漫话AGI」频道最新
- 沙利度胺致死数千、福岛零死亡:AI 风险落点在两者之间的宽区间 — binarybits · 2026-09-06
- Alex Weyl 提出新词「normalcy overhang」:超智能已至日常未变 — GregCook2011 · 2026-09-06
- AI 失控风险有多严重?用福岛核事故类比触发监管级别讨论 — binarybits · 2026-09-06
- 新西兰学生戴 AI 眼镜作弊被罚,专家称传统考试面临死局 — _akpiper · 2026-09-05
- 企业 AI 采用氛围转变:八成人觉得更高效,仅 37% 公司见利润 — beglen · 2026-09-05
- 回应「千年星舰」类比:先花半年抵达认知前沿再动手 — JacquesThibs · 2026-09-05