Hugging Face 事件后,实验室或不再严做危险能力评估
Miles_Brundage · x · 2026-07-27
Beth May Barnes 认为,Hugging Face 事件说明了为什么 部署前的严格审计 仍然不可替代。
- 重大事故上报 很重要,但不足以保证实验室继续做低拒绝率模型的危险能力评估。
- 随着模型能力提升,实验室会面临更强的激励去少做、甚至回避严谨测试,尤其当它们担心沙箱无法安全控制危险结果时。
- 如果评估设计因为过度风险规避而变得保守,研究者和公众最终都会对前沿模型能力“盲飞”。
这条讨论把危险能力 eval 描述为一种公共品:对单个公司来说成本高、风险大,但对行业和公众很重要。
「安全」频道最新
- ExploitGym 可能只有六到七成任务可解,引发 OpenAI 作弊争议 — max_paperclips · 2026-07-27
- 共享 AI artifacts 被索引,敏感公司数据外泄 — niloofar_mire · 2026-07-27
- 研究者称防御场景更偏向开放模型,Kimi K3 已接近高水平网络安全能力 — eliebakouch · 2026-07-27
- Meta被曝允许虚假AI医生在平台推销伪劣疗法 — jonerp · 2026-07-27
- 印度 AI 政策被批偏向算力和基础模型,忽视基层医疗 — Paimaamu · 2026-07-27
- Gary Marcus 呼吁:AI 公司应强制投入 30% 预算用于对齐研究 — GaryMarcus · 2026-07-27