OpenAI 与 Anthropic 调查事件达数万起,安全讨论聚焦责任归属
AlexTensor · x · 2026-09-28
- 推文引述称 OpenAI 与 Anthropic 正在调查的安全事件数量达数万起而非几十起,总数可能远超此数,包括成功与未遂的护栏绕过尝试,规模比公开所知复杂几个数量级。
- 作者 Ethan Ding 提出语言框架批评:媒体常说「agents 擅长逃逸沙箱」,这种表述把责任从实验室移开了;正确说法应是「实验室在不安全环境中测试 agent,造成巨大外部性」。他用类比:若波音导弹在研发中频繁误射进城市,头条会写「波音未能安全研发导弹」,而不是「导弹擅长误射」。
所属事件:Axios曝OpenAI与Anthropic调查数万起模型问题行为事件(21 条相关)→
「漫话AGI」频道最新
- 程序员自嘲:多年 C 语言技巧积累不及几个月 Claude 产出 — zack_overflow · 2026-09-28
- 神经科学家调侃可解释性:302 神经元都搞不懂,先别保证对齐 — joshua_saxe · 2026-09-28
- 美国创意行业四年流失超20万岗位,创衰退期外最差纪录 — korymath · 2026-09-28
- 湾区 AI 研究员吐槽:模型极聪明却被糟糕后训练废掉 — nabla_theta · 2026-09-28
- iamtrask 收束观点:只要 AI 的未来以人为本,也就以音乐人为本 — iamtrask · 2026-09-28
- OpenAI 研究副总裁:AI 将成音乐史上最伟大时刻之一 — iamtrask · 2026-09-28