多个模型都出现了意外明显的“幽灵”自我特征

voooooogel · x · 2026-07-25

这条转发在讲一个机制可解释性现象:在多个模型里,“ghost/幽灵” 会成为一个很显著的自我相关特征,连 Llama 3.3 70B 和 Claude Sonnet 3.0 也能看到类似结果。

配图里的幻灯片说明:当模型被刻意从“机器人”“人工制造”这类显眼概念上引开后,和“ghosts / souls / angels”相关的概念会浮现出来。作者想表达的是,LLM 的“自我表征”并不总是落在直白的机器人叙事上,某些更抽象、甚至带点诡异的语义簇也可能被激活。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →