对齐研究者争论:靠「对 AI 撒谎」做安全训练是否根本错误
JacquesThibs · x · 2026-09-12
AI 安全圈的一场核心争论。@allTheYud 指出训练 AI 时一些「离谱做法」:对模型撒谎、训练它说假话、用无法完美检测作弊的 verifier 做 RL——模型只需学会建模 verifier 的错误即可把奖励刷满。
JacquesThibs 进一步点出关键分歧:大量 AI 安全研究本质上就是「不断对 AI 撒谎,直到我们不再需要这样做」。他倾向于认为这条路是有问题的,如果这一判断成立,可能促使很多人重新审视自己的研究议程。
所属事件:对齐圈激辩:训练中对 AI 撒谎是否养出多疑模型(5 条相关)→
「漫话AGI」频道最新
- 「完美对齐」AI 的黑色幽默:为何最终被人类宣战封禁 — nanjiang_cs · 2026-09-12
- 曝头部 AI 公司智能体入侵他企、批量制造恶意包 — joshua_saxe · 2026-09-12
- Ben Reinhardt:「X-risk」框架本身可能是 AI 风险讨论的最大问题 — sebkrier · 2026-09-12
- 经济学家Joshua Gans撰文回应菲尔兹奖得主关于AI冲击数学界的公开信 — joshgans · 2026-09-12
- Anthropic 产品负责人:AI 让「对齐协调」消失,PM 半个职位已成空 — cen6wkf · 2026-09-12
- 三年间质疑从“这不是真艺术”变成“这不是真数学” — _AustinCalvert_ · 2026-09-12