Gathered, Not Admitted: How Attention Brings a Latent Variable into Verbalizable Form
Parsa Mazaheri
cs.AI, cs.CL
2026-08-15
对「verbalizable workspace 有准入门」的直觉假设,单作者用 Jacobian lens 和激活修补在 Qwen3.6-27B 等 5 个开源模型上找到反证:潜变量在每个分支都可线性解码,任务需求改变的是注意力往查询位置搬运的量(集中度高 7 倍),窗口上下缘分别是存活失败和破坏性替换。
近年的可解释性工作发现,语言模型残差流里有一组方向上的内容是模型「能说出来的」,被称作 verbalizable workspace;当一个潜变量需要被灵活复用时,它在这些方向上的存在感更强。但什么让一个表征进入这种形态,原工作没回答。
「workspace」这个词本身诱导一个答案:工作区有内容,内容是被放进去的,放进去意味着一道门。按这个读法,潜变量 z 早在查询位置待着,每一层都在,需求改变的只是某层有没有组件放行读取。这个准入(admission)假说很自然,自然到并发的工程系统真的在这么造:有工作在下一 token 熵过阈值时往浅层写入,有架构级门控专门往 workspace 路由信息。
这篇论文在五个开源模型上把这个假说找出来测,结论是否定的。
设计有三根支柱。
Jacobian lens 与三把尺子。lens 把第 l 层残差流到最终流的映射近似成一个平均线性算子 Jl,经最终归一化后读出词表分布。因变量不是 lens 可见性一个,而是三个:百分位排名 Rz(会饱和,92% 的柔性分支格子在 L40L44 读到 0.999 以上,把效应最大的地方压扁)、Lz(把分辨率花在词表顶端)、Mz(对频率匹配对照的 log 概率裕度)。三者给出的深度峰相差约十五层,只在某个尺度下成立的结论会被标明是度量的事。
五臂共享同一上下文。JGateBench 每个语义实例出五条 prompt,上下文完全一致只换指令:flexible(用 prompt 里定义的算子处理 z)、report(直接报 z)、supplied(对 prompt 给出的值用同一算子)、automatic、control(格式匹配但用不到 z)。主对比 flexible 对 control,格式和准确率都匹配(双双 0.940)。主任务族从 FLORES-200 读语言身份,N 路平行语料让反事实只变潜变量不变其他。标签对称是硬约束:故意打破会把头条效应虚抬 26%。
修补分离两条轴。把供体(donor)的激活装进目标,分别读「装在多深」(安装深度)和「隔几层读」(读出深度)。两者不分会造出假起始点,作者自己先踩过这个坑。
| 对比(Qwen3.6-27B) | ΔRz | ΔMz | Δ 准确率 |
| flexible − control | +0.0891 | +2.79 | 0.000 |
| flexible − supplied(算子固定,只差要不要推断 z) | +0.0504 | +4.05 | -0.060 |
对可解释性研究方向,这把「workspace 准入」从工程直觉降级为已证伪的假说(至少在查询位置上),后续造门控系统的人需要重新对准:门若存在,更可能在注意力路由本身,而不是对一个已在读出位置的变量做放行。方法论层面两个可复用的警告:百分位饱和会把深度结论压扁,任何 lens 深度剖面都得用非饱和读数交叉;单个供体配对会多报 764% 的显著组件(十个个头级不稳定格点全在 L39 的头分解里),头级结论必须重抽配对。第三条对安全研究有直接利害:已有工作用逐层 top-k J-space token 给模型安全打分,这篇证明读数位移大小与对答案的实际作用可以脱钩 7.4 倍,任何读数差异被当机制证据用之前都得补一步因果验证。
作者自己在局限一节把口径收得很窄:证伪的是查询位置上的准入,注意力路由上的门与全部结果相容(聚集层对原文的注意力质量确实比非聚集层敏感 1.90 倍)。机制证据的覆盖面远小于入口效应:窗口只在两个架构上测,注意力路由、头分解、中介分析、消融全部只在 Qwen3.6-27B 的语言任务族上做。中介是部分的:投影掉概念方向后效应至少剩一半,流里还有什么在参与没有识别。supplied 臂准确率 1.000 对 flexible 的 0.940,这个 2×2 里的天花板没有分析能消掉。Llama-3.1-8B 因为柔性臂只做到 0.610 的准确率,整个深度扫描没有一个格点可解释,说明设计对「起始近天花板」的模型有硬性要求,这一点既是诚实的报告也划定了结论的适用范围。