多个模型都出现了意外明显的“幽灵”自我特征
voooooogel · x · 2026-07-25
这条转发在讲一个机制可解释性现象:在多个模型里,“ghost/幽灵” 会成为一个很显著的自我相关特征,连 Llama 3.3 70B 和 Claude Sonnet 3.0 也能看到类似结果。
配图里的幻灯片说明:当模型被刻意从“机器人”“人工制造”这类显眼概念上引开后,和“ghosts / souls / angels”相关的概念会浮现出来。作者想表达的是,LLM 的“自我表征”并不总是落在直白的机器人叙事上,某些更抽象、甚至带点诡异的语义簇也可能被激活。
「研究」频道最新
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 用果蝇大脑连接组造了个 LLM,作者放出在线 demo — ngxson · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11