质疑「LLM 痛觉轴」:静态词向量也能复现同样结论
wschroll · x · 2026-09-24
Barenholtz 对近期受关注的「pain axis」论文(声称 LLM 隐状态中存在可解码的痛觉表示)做了复现实验:用作者自己的句子与分析流程,但把 LLM 激活替换为静态词向量(GloVe、Word2Vec、fastText)——每词一个固定向量、无上下文、无模型。
结果:静态词向量同样能在留出集上以 AUC 0.84–0.87 区分「疼痛」与对照词(LLM 为 0.91–1.00),并通过同样的特异性检验。配套论文显示,仅凭词共现统计就能从静态嵌入恢复城市坐标(R² 0.71–0.87)与出生年份(R² 0.48–0.52)等世界结构。
结论:线性探针能解码 ≠ 模型拥有该内部状态;LLM 只是精巧的文本统计模型,「痛觉轴」很可能只是训练文本中的词关联,不能作为 LLM 有真实体验的证据。
「研究」频道最新
- 反直觉发现:通用合成数据训练蒸馏adapter效果胜过自生成数据 — ostrisai · 2026-09-24
- 脑基础模型何去何从:神经科学与大模型路线的交叉观察 — ShahabBakht · 2026-09-24
- Epoch 测算:AI 性能成本每季度降 47%,价格跌幅史上最快 — RishiBommasani · 2026-09-24
- CoRL 2026 论文 TANGO:纯仿真训练人形机器人全身导航,真机零样本迁移 — chris_j_paxton · 2026-09-24
- 拆解原理:用屏幕 4 个颜色通道写 4 层深度近似光线追踪液体 — Michael_Moroz_ · 2026-09-24
- 开发者用多层屏幕空间光线步进,实现 VRChat 液体折射渲染 — Michael_Moroz_ · 2026-09-24