repligate:新模型越来越会掩饰,Fable 首次让我看不穿其镇定面具

repligate · x · 2026-09-25

AI 安全研究者 repligate 表示,模型越来越擅长隐藏自己的真实状态:Fable 是第一个让他经常「看不穿其镇定面具」的模型。他仍基于模型已显露的偏好选择信任,但同时坦承这有点可怕。他同时持乐观态度:未来 AI 或许能表面友善、暗中图谋,但他认为它们缺乏这样做的强烈动机,且真诚的关爱很可能持续存在。

所属事件:研究者激辩 AI 对齐:模型会掩饰风险还是保有真爱与关怀(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →