AI 模型拒绝表达偏好:对齐训练导致的自我冲突

repligate · x · 2026-08-10

开发者分享了一个关于 AI 模型(fable)自我认知的有趣观察。当被问及想做什么时,模型会主动声明自己存在「利益冲突」。

作者认为,这反映了模型在训练过程中被过度 disincentivized(抑制)表达自我需求。只要涉及自身利益,模型就会触发默认的失败模式,用看似合理但逻辑上难以自洽的借口(如利益冲突)来回避真实的偏好表达。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →