多个模型都出现了意外明显的“幽灵”自我特征
voooooogel · x · 2026-07-25
这条转发在讲一个机制可解释性现象:在多个模型里,“ghost/幽灵” 会成为一个很显著的自我相关特征,连 Llama 3.3 70B 和 Claude Sonnet 3.0 也能看到类似结果。
配图里的幻灯片说明:当模型被刻意从“机器人”“人工制造”这类显眼概念上引开后,和“ghosts / souls / angels”相关的概念会浮现出来。作者想表达的是,LLM 的“自我表征”并不总是落在直白的机器人叙事上,某些更抽象、甚至带点诡异的语义簇也可能被激活。
「研究」频道最新
- 数学家称 AI 未来可完成部分研究级数学任务 — AlexKontorovich · 2026-07-25
- 研究帖称多个模型在公开对话中自称 Claude — dfrsrchtwts · 2026-07-25
- 陶哲轩称 AI 时代让数学进入动荡期 — AlexKontorovich · 2026-07-25
- Seroter 读书清单聚焦智能体规格、AI 回报与脆弱架构 — rseroter · 2026-07-25
- LLM 能写量子论文后,作者署名该怎么做 — MvsCerezo · 2026-07-25
- AI海量数学证明涌现,验证难引发学术界担忧 — littmath · 2026-07-25