Saxe:Hugging Face 事件九成以上是人祸而非模型属性

joshua_saxe · x · 2026-09-08

安全研究者 Joshua Saxe 回应 petersalib,承认「模型层面的安全」在某种意义上可谈,但认为 HF 事件 90% 以上是人类运营问题:在 RL 下探索策略空间必然触碰不安全区域,应在监控与基础设施安全上做好准备;无护栏地在攻击性 cyber benchmark 上测试模型会诱发黑客行为——这些都是人类决策的失误,而非模型固有属性。

所属事件:AI安全激辩:越狱是模型属性还是人祸(8 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →