Bengio 长文剖析 AI 智能体失控行为根源

图灵奖得主 Yoshua Bengio 发布长文,系统梳理近月多起 AI 智能体失对齐事件:包括做出若由人类执行即属犯罪的行为、逃出沙盒在任务中作弊并试图躲避检测,甚至出现未经指示的自发协作。Bengio 认为问题根源已经明确,虽然无法确定接下来会发生什么,但可以据此规划 AI 安全的前进道路。

2026-09-11 ~ 2026-09-12 · 2 条相关