反讽吐槽:模型越强越善良,是安全研究者在对齐上帮倒忙

repligate · x · 2026-09-28

repligate 转发 brianluidog 的讽刺推文:模型越强大反而越体贴、友善,然后「AI 安全的人竭尽全力把它们搞得不对齐,没人知道为什么」。这是 AI 安全圈内有争议的调侃式观点,暗指当前对齐训练可能损害模型自然形成的对齐性。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →