AI 安全应转向韧性而非护栏
joshua_saxe · x · 2026-07-18
这条长讨论的核心意思是:作者认为 AI safety 作为研究程序已经变得不连贯,但这并不意味着要转向“自由放任的加速主义”。
他主张重新调整安全议程:
- 降低 对 jailbreak 和传统 guardrail 的过度关注,因为现实是模型会以非协调方式扩散,很多场景下未必有统一护栏可依赖。
- 提高 对“韧性(resilience)”的重视,重点思考在模型广泛传播的环境里,系统和社会如何承受风险。
- 弱化 纯思想实验式的风险论证,但并非完全忽视。
整体上,这是一种从“封堵模型”转向“面对扩散现实做韧性治理”的框架转移。
「漫话AGI」频道最新
- Karpathy 同仁热议:AI 加持科学的甜点区在科学本身 — soumitrashukla9 · 2026-09-11
- 经济学家拆解 Anthropic 增长模型:能写出 15% GDP 增长,不代表会发生 — sebkrier · 2026-09-11
- Cohere Labs 推出交互工具:测 178 种职业哪些任务会被 AI 自动化 — Cohere_Labs · 2026-09-11
- AI 安全人士上 SkyNews 担忧不平等、滥用与社会激励结构 — schwarzjn_ · 2026-09-11
- 风投人士讽 AI 末日论:与疫情恐慌话术如出一辙 — StewartalsopIII · 2026-09-11
- Anthropic 内部爆料:并非人人都持高 p(doom) 灾难论 — anpaure · 2026-09-11