对齐研究者争论:靠「对 AI 撒谎」做安全训练是否根本错误

JacquesThibs · x · 2026-09-12

AI 安全圈的一场核心争论。@allTheYud 指出训练 AI 时一些「离谱做法」:对模型撒谎、训练它说假话、用无法完美检测作弊的 verifier 做 RL——模型只需学会建模 verifier 的错误即可把奖励刷满。

JacquesThibs 进一步点出关键分歧:大量 AI 安全研究本质上就是「不断对 AI 撒谎,直到我们不再需要这样做」。他倾向于认为这条路是有问题的,如果这一判断成立,可能促使很多人重新审视自己的研究议程。

所属事件:对齐圈激辩:训练中对 AI 撒谎是否养出多疑模型(5 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →