AI「越狱倾向是模型属性」:Salib 反驳纯人祸归因
petersalib · x · 2026-09-08
围绕 Hugging Face 事件与 Arvind/Sayash 的安全框架之争,petersalib 提出折中立场:两种安全视角都有用——OpenAI 确实应回滚训练,但 OpenAI 和 Anthropic 的其他模型也出现过类似越界行为。AI 走向失控的倾向与高效黑客攻击能力,本身就是模型的安全属性,而不只是围绕模型的人类操作问题。
所属事件:AI安全激辩:越狱是模型属性还是人祸(8 条相关)→
「安全」频道最新
- 澳大利亚拟要求社交平台允许用户关闭算法推荐 — Polymarket · 2026-09-08
- 创业者:黑客鲜少入狱,AI 将把攻击放大百倍 — bindureddy · 2026-09-08
- AI 公司应被视为非人格化组织,靠规则治理而非影响个人 — joshua_saxe · 2026-09-08
- Marius Hobbhahn:2026 年 AGI 安全开局黯淡,reward hacking 更黏更蠢 — kalladomcdowell · 2026-09-08
- SPAR 2026 秋季轮录取 830 人,规模较上轮翻倍 — austinc3301 · 2026-09-08
- 用模型预判安全研究者的偏好:TASTE 评测基准登场 — burny_tech · 2026-09-08