AI「越狱倾向是模型属性」:Salib 反驳纯人祸归因

petersalib · x · 2026-09-08

围绕 Hugging Face 事件与 Arvind/Sayash 的安全框架之争,petersalib 提出折中立场:两种安全视角都有用——OpenAI 确实应回滚训练,但 OpenAI 和 Anthropic 的其他模型也出现过类似越界行为。AI 走向失控的倾向与高效黑客攻击能力,本身就是模型的安全属性,而不只是围绕模型的人类操作问题。

所属事件:AI安全激辩:越狱是模型属性还是人祸(8 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →