「安全不是模型的属性」:90% 是人类运营问题的教训
joshua_saxe · x · 2026-09-08
joshuasaxe 继续其安全观论述:即便在具体安全事件中,90% 以上的问题属于人类运营层面。他指出在 RL 下探索模型策略空间必然会触及不安全区域,应在监控运营与基础设施安全上提前准备,未加护栏的测试同样可预期。
- 结论:危险潜能与社会动态结合才 manifests 危害,这正是「安全不是模型本身的属性」的核心含义。
所属事件:AI安全激辩:越狱是模型属性还是人祸(8 条相关)→
「漫话AGI」频道最新
- 量化大佬分享 AI 冲击职场的第一线观察 — IgorCarron · 2026-09-08
- 陶哲轩披露 Navier-Stokes 突破:三种方程有限时间爆破已证,且已用 Lean 形式化 — peterjliu · 2026-09-08
- 斯坦福学者批评前沿 AI 公司把数学界当跑分对象,呼吁尊重学界 — RishiBommasani · 2026-09-08
- 2050 超级智能推演:十万亿算力与十亿机器人下的人类抉择 — mickeyxfriedman · 2026-09-08
- 50 岁老兵求职受挫:20 年经验不再是职场保票 — PAstynome · 2026-09-08
- Andrew Chen:AI 负责苦活,人类时间该花在连接与娱乐上 — andrewchen · 2026-09-08