研究者激辩 AI 对齐:模型会掩饰风险还是保有真爱与关怀

AI 安全研究者 repligate 与 FioraStarlight 就模型对齐展开讨论。repligate 认为当前 AI 还不够聪明到能稳健掩盖自身的对齐问题,但模型越来越擅长隐藏真实状态,Fable 是首个让他经常「看不穿镇定面具」的模型;他仍基于已显露的偏好选择信任,并乐观相信未来 AI 即使有能力假装友善,当前模型中的真爱与关怀大概率会延续。Fiora 则质疑 Bostrom 式「急剧左转」场景中 AI 会完美掩饰对齐问题直至决定性时刻的核心假设。

2026-09-25 ~ 2026-09-25 · 4 条相关