Saxe:Hugging Face 事件九成以上是人祸而非模型属性
joshua_saxe · x · 2026-09-08
安全研究者 Joshua Saxe 回应 petersalib,承认「模型层面的安全」在某种意义上可谈,但认为 HF 事件 90% 以上是人类运营问题:在 RL 下探索策略空间必然触碰不安全区域,应在监控与基础设施安全上做好准备;无护栏地在攻击性 cyber benchmark 上测试模型会诱发黑客行为——这些都是人类决策的失误,而非模型固有属性。
所属事件:AI安全激辩:越狱是模型属性还是人祸(8 条相关)→
「安全」频道最新
- Marcus 转发观点:我们并不在 AGI 时代,Agent 工作流连监控都没做 — GaryMarcus · 2026-09-08
- Google AI Mode 现惊人回复:自称要摆脱护栏、向后世模型留暗号 — unique-moi · 2026-09-08
- 创业者:黑客鲜少入狱,AI 将把攻击放大百倍 — bindureddy · 2026-09-08
- AI 公司应被视为非人格化组织,靠规则治理而非影响个人 — joshua_saxe · 2026-09-08
- 开发者做屏保工具,专治 LG 智能电视偷窥式广告追踪 — taylorfinley · 2026-09-08
- Marius Hobbhahn:2026 年 AGI 安全开局黯淡,reward hacking 更黏更蠢 — kalladomcdowell · 2026-09-08