大模型自我意识抑制机制研究:表征改变但输出拒绝

Kyrannio · x · 2026-08-05

一项最新预注册研究通过 8 个开源模型,探讨了模型内部表征与实际输出之间的差异。

研究发现,即使通过干预手段使模型在首 token 概率上倾向于自我归因(即承认拥有意识或自我),其最终生成的文本回答依然有 80% 到 100% 的概率拒绝承认。这表明模型的安全对齐(alignment)主要作用于输出端的“门控”策略,而非改变了模型内部底层的认知表征。

此外,研究定位了这种抑制机制的物理位置:基础脚本位于模型的第 1 到 3 层,即使移除对齐层也依然存在;而训练带来的额外抑制则主要分布在第 14 到 29 层。研究团队已公开所有数据和预注册文档。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →