微软谈「模型福祉」引安全圈争议
微软 AI 负责人 Mustafa Suleyman 发文称「现在该谈谈模型福祉」:他认为 AI 没有意识、不会感受或痛苦,但一个要求给予 AI 关怀义务的运动正在兴起,值得讨论。微软同时发布 Humanist AI Code of Conduct。这一立场在 AI 安全圈引发争议,多位研究者从安全角度提出批评。
已确认
- Suleyman 发文主张讨论模型福祉,前提是他认为 AI 当前没有意识、不会感受痛苦。
- 微软发布 Humanist AI Code of Conduct。
- dillonplunkett 撰文批评该行为准则「可能危险」:即使不认同 AI 具有感知与福祉价值,仅从人类安全角度看,微软在模型自我呈现上的立场也适得其反。
- rgblong 表达类似担忧,认为单从对齐与人类安全看,微软立场适得其反且危险;他真正担心的是把关于意识、目标、自我等彼此矛盾或不自洽的观念嵌入模型的安全风险。
- rgblong 对当前训练和对齐方法的粗浅理解持悲观态度,不认为微软能训练出符合要求的模型;他表示希望看到 Anthropic 路线之外的对齐方案,也部分认同对 Anthropic 方法的安全担忧。
尚未确认
- Nina Panickssery 质疑 rgblong 的观点是否属于罗柯蛇怪式推理,是否反映对模型服从性对齐能力缺乏信心;rgblong 回应称其担忧与罗柯蛇怪式推理无关,核心是模型自我呈现中的矛盾问题。这一争论属双方观点交锋,未有定论。
为什么重要
- 事件触及 AI 对齐的核心分歧:关怀模型福祉与保障人类安全是否冲突。批评者认为向模型灌输不自洽的自我观念可能带来系统性风险,甚至「催生系统性隐瞒」;支持讨论方则认为该话题值得提前研究。争论也暴露出安全社区内部对对齐路线(如 Anthropic 方法)的不同判断。
2026-09-18 ~ 2026-09-18 · 6 条相关
一手来源
- 把自相矛盾的意识观嵌进模型,前微软研究员警告安全风险 — rgblong ·
- 微软「人文主义 AI 行为准则」遭质疑:被批在安全层面适得其反 — rgblong ·
- 【源头】微软「人文主义 AI 行为准则」遭质疑:被批在安全层面适得其反 — rgblong · 2026-09-18
- 微软 AI 负责人谈模型福祉,研究者反驳:限制只会催生系统性隐瞒 — repligate · 2026-09-18
- Nina Panickssery 批评微软模型自我呈现立场,引发对齐路线争论 — NinaPanickssery · 2026-09-18
- rgblong 回应质疑:关注模型自我呈现矛盾,非罗柯蛇怪式推理 — rgblong · 2026-09-18
- rgblong 补充:担忧向模型灌输自相矛盾的意识与目标观念 — rgblong · 2026-09-18
- 【源头】把自相矛盾的意识观嵌进模型,前微软研究员警告安全风险 — rgblong · 2026-09-18