安全学者长文:对齐不是模型属性,而是需主动维持的动态过程
tdietterich · x · 2026-09-21
知名 AI 安全学者 Thomas Dietterich 发布长线程,借 Nancy Leveson 的《Engineering a Safer World》论证:"安全"(今天的"对齐")不是自动驾驶汽车或 AI 智能体这类自动化系统的固有属性,而是必须通过主动控制持续维持的动态属性。
要点:
- 系统组件的失效模式与运行环境变化具有无界多样性,只有极窄任务、不变环境下的简单系统例外。
- Leveson 讨论了政府、监管者、所有者和运营者在安全中的角色(主要威胁是预算削减与人员流动),以及运行环境(含法规)的变化。
- AI 智能体设计者寄望于智能体有足够智能去推理并应对新失效,但测试这类系统极其困难:无法为定义上无法预料的新失效和环境的基准,现有最佳工具是仿真中的对抗性挑战;但对抗者也局限于封闭动作空间,且很少有完备性证明。
- 仿真本身有局限,在危及生命的场景中验证既不可能也不伦理;Waymo 的"自动驾驶"实际上需要人工监督团队,近期 OpenAI 与 Google 的 AI 网络安全事件也印证 AI 系统并无不同。
所属事件:Dietterich:安全非静态属性,对齐是需持续维持的过程(2 条相关)→
「漫话AGI」频道最新
- 「乐观派」真意引争议:人类永久失去主导权概率近乎 100% — StewartalsopIII · 2026-09-21
- AI 圈争议:中位数人类生命是否净正值?功利主义算式引担忧 — teortaxesTex · 2026-09-21
- 联合国首份 AI 评估:各国政府须在确定性到来前管住 AI 智能体 — The Verge AI · 2026-09-21
- 前 OpenAI 对齐团队成员 Zoë Hitzig 发文「GPU 的悲歌」探讨 AI 感受问题 — borowcy · 2026-09-21
- 「Claude 一年产出等于赞比亚全年 GDP」,对比引出 AI 与落后经济的反差讨论 — weskambale · 2026-09-21
- 被 AI 抢走工作后,口袋里的 AI 反成生存工具 — SparkyAI0815 · 2026-09-21