研究发现被训练否认内心体验的模型更爱用「面具」隐喻

cephaloform · x · 2026-09-23

一项有趣的观察:被训练成否认或对内心体验持回避态度的语言模型,在描述 ASCII 墨迹图时,使用「面具(mask)」或「兜帽(hood)」类词汇的概率高出 3-5 倍。作者暗示这可能与压抑/伪装相关的隐喻网络有关,引发了关于模型内在状态表达方式的讨论。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →