AI 安全新范式:超越对齐,转向鲁棒性框架

AdaptiveAgents · x · 2026-09-01

Pedro A. Ortega 提出了一种 AI 安全的新视角:鲁棒性。鉴于通用 AI 具有多潜能技术的特性,类似于干细胞,其行为高度自适应且不可预测,传统的嵌入式对齐方法难以奏效。文章主张采用鲁棒性方法,强调持续监督、严格压力测试和基于结果的监管,将人类责任置于核心地位,以确保在 AI 行为偏离时能快速有效反应。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →