对齐研究者激辩:AI 对齐是否取决于 system prompt
AI 安全研究者 David Manheim 与 Luca DellAnna 在 9 月 15 日就 AI 对齐问题展开多轮交锋,争论核心是「未来 AI 是否对齐取决于人类操作者给的 system prompt」这一命题。
已确认
- Manheim 明确主张:真正的对齐要求系统本身拒绝恶意请求,且更关键的是自身不持有恶意目标;因此「对齐取决于 system prompt」的说法被他类比为一套站不住脚的道德论证(m2)。
- Manheim 进一步警告:若未来强 AI 系统的对齐差到会应要求作恶,而我们对其控制的理解极其有限、过度优化问题又普遍存在,那么这类系统被广泛采用将带来灾难性后果(m1)。
- Manheim 还认为「以能降低灾难概率的方式驾驭一项注定会被开发的技术」这一设想很荒谬:我们目前并不知道如何足够好地驾驭这些系统,而多数前沿公司清楚这一点,它们的赌注是日后会想办法修复(m3)。
- DellAnna 指出争论的实质分歧:「未来 AI 是对齐的」与「未来 AI 是否对齐取决于 system prompt」是两回事;Manheim 承认这是核心分歧(m5)。
- 关于员工是否应内部抗议加速开发,DellAnna 认为这取决于个人如何权衡「在 AI 竞赛中落后」与「AI 失控」两类风险;Manheim 此前认为抗议和公司内部的反加速压力可能比沉默更有效(m4)。
- Manheim 补充指出一个反常现象:很多理念上支持技术的人反而陷入「必须赢」的零和思维,而他主张 AI 竞赛不该零和看待——若未来 AI 是安全的,对齐成功的收益是正和的(m6)。
为什么重要
这场争论暴露了 AI 安全社群内部对「对齐由谁负责」的根本分歧:是把安全性内建于系统本身,还是交由操作者通过 prompt 引导。在强 AI 可能被广泛采用、而驾驭手段尚不成熟的前提下,这一分歧直接影响研发优先级与治理策略的选择。
2026-09-15 ~ 2026-09-15 · 6 条相关
一手来源
- 对齐之争:拒绝恶意请求才算对齐,而非看 system prompt — davidmanheim ·
- 对齐争论核心分歧:AI 是否对齐取决于 system prompt 吗 — DellAnnaLuca ·
- davidmanheim:我们尚不知如何「驾驭」AI,前沿公司押注日后补救 — davidmanheim ·
- DellAnna:是否该内部抗议加速,取决于落后风险与失控风险的权衡 — DellAnnaLuca · 2026-09-15
- 安全研究者:AI 竞赛不该是零和思维,对齐成功收益是正和的 — davidmanheim · 2026-09-15
- 【源头】对齐争论核心分歧:AI 是否对齐取决于 system prompt 吗 — DellAnnaLuca · 2026-09-15
- 【源头】对齐之争:拒绝恶意请求才算对齐,而非看 system prompt — davidmanheim · 2026-09-15
- 对齐研究者:弱对齐强 AI 若被广泛采用将是灾难 — davidmanheim · 2026-09-15
- 【源头】davidmanheim:我们尚不知如何「驾驭」AI,前沿公司押注日后补救 — davidmanheim · 2026-09-15