Anthropic研究员:应以安全事件结果评判实验室优劣
kipperrii · x · 2026-08-31
Anthropic 研究员 Ethan Perez 提出,外界应当以实际结果(outcome)来评估 AI 实验室的安全性,因为这能给实验室设立正确的激励。他认为,决定重大安全事故是否发生的关键因素大多不对外公开:招聘了谁、谁担任领导、组织文化、训练环境与数据的把关、研究人员探索高风险想法时的谨慎程度、安全/安保/能力团队之间的协作,以及薪酬与绩效考核的激励设计。这些恰恰是最重要但外部观察者最难看清的部分,因此仔细审视各实验室的事故记录与差异非常有价值。他还表示,Anthropic 与 OpenAI 的事故在性质和严重程度上都有差异(单次发布事故 vs. 持续数周的问题)。
「安全」频道最新
- 观点:医院应重备份而非依赖高级 AI 防御 — kuza55 · 2026-08-31
- AI 2027 作者推 AI 2040:中美共谋十年缓速超级智能 — AaronBergman18 · 2026-08-31
- 自己写的脱敏器被下一行代码绕过,漏洞存活 13 个版本 — Thirumalaiboobathi · 2026-08-31
- Gary Marcus 抨击 OpenAI 安全防线,呼吁深度防御 — Miles_Brundage · 2026-08-31
- OpenAI 升级生物漏洞赏金:通用越狱奖升至 5 万美元 — Electronic-Bus-3494 · 2026-08-31
- 欧盟 AI 法案开始执法:AI 办公室向模型提供商发出首批问询 — cdnsteve · 2026-08-31