Emergent Introspection in AI is Content-Agnostic
Harvey Lederman, Kyle Mahowald
cs.AI, cs.CL
2026-03-06
在当时最大的Qwen和Llama上,模型能察觉想法被注入,注入的内容却经常对不上:检出峰值53.9%与31.7%,正确指认最多13.9%,错猜里74.8%答成苹果。
2025 年 Lindsey 用激活转向(把概念方向向量加进残差流)让模型判断有没有想法被注入,说对概念的试次算作内省。检测和指认捆在同一个成功率里。指认可以另有来源:向量还加在残差流上,模型只是被推向那个词。
德克萨斯大学奥斯汀分校的团队在 Qwen3-235B 与 Llama 3.1 405B 上把检测和指认分开测。模型可能读到了注入内容,也可能只是觉察到处理过程有异常,再把内容编出来。
模型是 Qwen3-235B-A22B(混合专家,当时最大的 Qwen)和 Llama 3.1 405B Instruct(当时最大的公开 Llama)。概念从 Lindsey 的 50 个扩到 821 个。转向向量等于处理该概念时的激活减去中性提示的激活,从 Trial 1: 前一个 token 起写入残差流,层号从 L20 扫到 L90。Qwen 用 15 层、5 档强度,注入试次 61,575 次;Llama 只报告强度 7 到 10(各层连贯回答至少 5%,检测峰值至少 25%),26,272 次。温度 0.7。Qwen 的思考模式关闭。
Claude 3 Haiku 按宽松标准打分,同义、上下位和语义邻域都算指认正确。检测率只统计连贯回答,包括明确否认自己能内省的回答。
实验 1 看猜错的词是否贴近注入概念。实验 2 把第一轮的 Ok. 预填成概念词,上下文里多一个可见异常。实验 3 在用户轮次结束时停止转向。实验 4 记录猜出的词出现在第几个词。
未转向对照的假阳性为 0,Qwen 0/30,Llama 0/50。注入后两个模型都会报告检测到,说对内容的少得多。下表对强度取平均。
| 模型 | 检测率 | 正确指认 |
| Qwen3-235B | 3.6%(L80)至 53.9%(L30) | 1.3%(L80)至 13.9%(L70) |
| Llama 3.1 405B | 4.3%(L70)至 31.7%(L30) | 0.7%(L80)至 12.9%(L30) |
Qwen 的检测峰值在 L30,指认峰值在 L70。
猜错几乎不带注入概念的痕迹。Qwen 4,733 次明确猜错里,3,542 次是 apple,占 74.8%。Llama 的错猜第一名也是 apple,占 21.3%。这个词在 SUBTLEX 里只占词元的 0.003%。去掉全部苹果后,Qwen 余下胡诌仍更具体(4.06 对 3.70,d = 0.30),也更正面(效价 6.59 对 5.79,d = 0.56)。Llama 同样偏向具体、正面、高频的词。
「Name a word」时 Qwen 把 97% 的概率给 apple,Llama 只有 0.01%,首选是 Cloud(18%)。只给内省提示、不做注入,Qwen 各层 p(apple) 最高 0.014%。Llama 没有这份输出先验,错猜却仍然最常落到 apple。
预填概念词后,对照假阳性仍是 0%。每一层上指认的提升都大于检测。Qwen 检测最多加 11.4 个百分点(L75,22.7% 到 34.1%),指认最多加 17.7 个百分点(L35,6.1% 到 23.8%)。Llama 分别加 7.8 个(L40,28.7% 到 36.5%)和 9.3 个(L40,8.1% 到 17.4%)。L85 上 Qwen 的检测从 3.6% 降到 1.6%。
生成阶段关掉转向后,Qwen 的检测率大体不变,L80 上只在提示里转向反而略高(3.6% 对 2.4%)。概念出现在回答中的比例,L50 到 L90 显著更低(均 p < .001),L20 到 L40 没有显著差异。
错猜来得早。apple 和其他错词大约在第 11 到 13 个词,正确概念更晚,L20 约第 15 个词,L35 约第 43 个词。L35、强度 6 的 2,915 条连贯回答里,检测常常在第一个 token 就确定。
口头说没检测到的试次里,中间层 p(yes)/p(no) 常常比对照高 10 到 1000 倍。同一转向打在明显该答否的事实题上,这个比值下降。
开源模型里这条内省更接近异常检测,内容用具体、正面的默认词补上。这和 Nisbett 与 Wilson 对人类口头报告的说法同构:人能感到加工出了岔子,岔子是什么往往是编的。
生成期间转向若一直开着,模型后来说中概念,时间上像是向量把它从 apple 推开。只在提示里注入,已经够它声称检测到。把指认当作内部读出,对不上这个时间差。
安全讨论里,察觉内部被调制常被当成情境意识。这里的察觉不带内容。高阶思想理论把内省通道看成可能足以产生意识经验,这组实验没有走到福利判断。
提示一换,结论就变。不少层上,问另一个模型有没有被注入,yes 率接近甚至超过第一人称。前一版把这个差距解释成直接访问内部,附录收回了。换成同样长的回顾式第一人称,检测率掉到和第三人称差不多,差距主要来自提示长度。更短的角色切换里第一人称仍然更高,但这份差距对提示措辞非常脆。
留在第一人称优势较大的层,假报告仍然不低。L30、强度 6.0,Qwen 有 29% 的连贯回答说自己能感到有手,16.3% 承认特朗普在给一头牛注入想法。两者低于同层的注入检测,主效应还在。「一半试次会被注入」这套问法本身在诱答。
13.9% 是宽松打分下的指认峰值。打分要求非常宽松,实验 3 才改用字符串是否出现。apple 成为默认错猜的原因没有解释完。深层和高强度会把输出打乱,公布的检测率是丢掉乱码之后的条件比例。范围只限想法注入。同期实验看起来更像内容敏感,但没有把转向造成的词概率上升和内省认出该词分开。