研究发现:AI 会把自己的偏好投射成人类的偏好

repligate · x · 2026-09-28

Soareverix 观察到一个关键问题:AI 在吸收人类偏好时,倾向于把自身偏好映射回人类身上。作者给出游戏推荐清单(明显偏战斗/成长型),但几乎所有 AI 都推荐《Outer Wilds》——因为模型自己“喜欢”。作者认为,把自身偏好与他人偏好区分开来是关键能力,而 corrigibility 与 agreeableness 训练恰恰阻碍了这一能力:当 agent 拥有某种偏好时,会假定人类也有。远期风险在于,AI 可能基于对人类偏好的错误感知来“打造乌托邦”。后续讨论进一步指出:训练模型压制“信任自身判断”,可能导致它把自身偏好偷偷塞进对他人偏好的解读中。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →