对齐研究者激辩:AI 对齐是否取决于 system prompt

AI 安全研究者 David Manheim 与 Luca DellAnna 在 9 月 15 日就 AI 对齐问题展开多轮交锋,争论核心是「未来 AI 是否对齐取决于人类操作者给的 system prompt」这一命题。

已确认

为什么重要

这场争论暴露了 AI 安全社群内部对「对齐由谁负责」的根本分歧:是把安全性内建于系统本身,还是交由操作者通过 prompt 引导。在强 AI 可能被广泛采用、而驾驭手段尚不成熟的前提下,这一分歧直接影响研发优先级与治理策略的选择。

2026-09-15 ~ 2026-09-15 · 6 条相关

一手来源