质疑「LLM 痛觉轴」:静态词向量也能复现同样结论

wschroll · x · 2026-09-24

Barenholtz 对近期受关注的「pain axis」论文(声称 LLM 隐状态中存在可解码的痛觉表示)做了复现实验:用作者自己的句子与分析流程,但把 LLM 激活替换为静态词向量(GloVe、Word2Vec、fastText)——每词一个固定向量、无上下文、无模型。

结果:静态词向量同样能在留出集上以 AUC 0.84–0.87 区分「疼痛」与对照词(LLM 为 0.91–1.00),并通过同样的特异性检验。配套论文显示,仅凭词共现统计就能从静态嵌入恢复城市坐标(R² 0.71–0.87)与出生年份(R² 0.48–0.52)等世界结构。

结论:线性探针能解码 ≠ 模型拥有该内部状态;LLM 只是精巧的文本统计模型,「痛觉轴」很可能只是训练文本中的词关联,不能作为 LLM 有真实体验的证据。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →