层间熵轨迹像指纹:同家族模型扩张与剪枝节奏一致

Entropy-Lens: Uncovering Decision Strategies in LLMs

Riccardo Ali, Francesco Caso, Christopher Irwin, Pietro Liò

cs.LG, cs.AI, cs.CV

2025-02-23

剑桥用 logit-lens 熵把残差流压成层间轨迹:同家族模型扩张/剪枝节奏对齐,任务与文体可分,打断扩张层往往比打断剪枝层更伤 MMLU。

这篇在解决什么

可解释性大多盯隐空间几何,很少直接看词表上的中间预测。词表分布又高维又无序,均值方差这类统计不好用。剑桥大学这组人的做法很克制:每层把残差流用模型自己的输出头投到词表(logit-lens),只记下这个分布的熵。一条按层排列的标量,他们叫熵剖面。

熵升被读成候选集在扩张,熵降被读成在剪枝。候选定义为 top-p(p=0.6)里的 token。Spearman 相关支持这个读法:Llama-3.2-1B / 3B 为 0.8250 / 0.7365,Gemma-2-2B / 9B 为 0.8804 / 0.8540。相邻层的 top-p 集合重叠也高,所以涨跌主要是同一批候选在变胖变瘦,不是完全换人。

方法

对每个生成 token、每一层,算一次 Shannon 熵,得到长度等于层数的剖面;一次生成里多个 token 的剖面拼起来,再交给 kNN 当诊断器。kNN 不是要上线的分类器,AUC 高只说明这些剖面彼此分得开。主实验冻结现成 Instruct 模型,不用梯度、不用探针头。Shannon 熵被当成默认;Rényi 熵在 α=0.5/1/5 上结论稳定。

结果

12 个解码器模型(约 100M 到 9B,GPT / Gemma / Llama / Qwen)在空白提示下的剖面,按家族聚成团,不按参数量。深度归一化之后,同家族不同尺寸的轨迹对齐:小模型像是大模型那条扩张–剪枝节奏的粗采样。GPT 家族往往高熵开场再慢慢收尖;Llama 更像先低熵、中段平台、最后再收。

任务类型分得开。TinyStories 上生成续写、数词、抽主旨三类任务,每类 800 条提示,kNN 三分类 AUC:Gemma-2 2.1B / 8.9B 为 97.66 / 98.38,Llama-3.2 1B / 3B 为 94.94 / 94.77,Llama-3-8B 为 96.10,Phi-3 3.6B 为 97.07。打乱故事词序当对照,说明信号不只来自词面。输出体裁同样可分:诗、科学短文、聊天记录,Gemma-2-2B-it 在 Shannon 熵上 AUC 98.7±1.1,Llama-3.2-1B-it 为 97.8±2.4。

MMLU 上,熵剖面还能区分对错。Llama 三种提示下模型准确率 50.89–60.62,kNN AUC 67.23–73.61;Gemma 准确率约 55–56,kNN AUC 68.36–72.78。干预实验按层跳过最大熵增(扩张)或最大熵减(剪枝),并对照随机跳层。Llama 各变体跳过单层最大扩张,准确率会掉到随机水平。Gemma2-2B-it 是例外,剪枝层更关键。

为什么重要

不用训练探针,一次前向就能读出「这层在扩候选还是在收」。家族指纹对选底座、迁尺寸有用:同家族不同大小更像同一套计算被切得更细。做层跳跃或早退时,优先保护扩张层,至少在 Llama 上是这样。

局限与存疑

论文承认:还不知道是哪些结构或训练阶段把剖面塑成家族形状;SFT / RLHF 会不会翻转扩张与剪枝的相对重要性,只有 Gemma2-2B-it 一个反例。主实验停在解码器 Transformer,MoE 和 ViT 只在附录里点到。kNN 的高 AUC 证明可分,不证明这些策略在因果上「就是」扩张和剪枝。跳层是把该块对残差的贡献置零,和真实早退或剪枝训练不是一回事。

术语

原文与代码

相关论文

全部论文解读