四类方向的U-Lens,控长后AUROC高1.9-4.7点

U-Space: Uncovering When and Why Uncertainty Arises in Language Models

Tobias Braun, Nils Loose, Alexander Herzog, Virginia Ceccatelli, Marcus Rohrbach, Thomas Eisenbarth, Lorenzo Cavallaro

cs.CL, cs.AI, cs.LG

2026-10-07

U-Lens把隐藏状态投到四类犹豫方向上,再乘平均预测熵。三个推理模型、四项基准上,控长度后AUROC比最强基线高1.9到4.7个点,一次生成、不用标签。

这篇在解决什么

推理模型的错答往往更长。只拿生成长度当不确定分数,三个模型、四项基准平均下来 AUROC 有 68.6%,离要正确性标签的 Feature-Gaps(68.8%)差 0.2 个点,比五次前向的 TokUR(69.6%)低 1.0 个点。按 token 数切成十个分位箱、只在箱内比较,长度掉到 52.4%。分数里有多少来自「写得长」,得单独看。

语义熵要采十次再聚类,TokUR 要五次前向,P(True) 的未控 AUROC 只有 56.7%。这些方法最后给出一个标量,看不出犹豫落在哪个 token,也分不清是含糊、缺信息,还是证据互相矛盾。

方法

U-Space 是残差流里的低维子空间。残差流就是各层读写的隐藏状态通道,用来放说得出来的犹豫。构造不用对错标签,也不更新被测模型。

锚来自两份词表:Chen 等人的 61 个犹豫线索,Rocklage 等人 certainty 词表里不低于语料均值的 348 个单词。去掉被切成多个 token 的词之后,一个独立的句子编码器把词分进四类:歧义、信息缺失、证据冲突、笼统不确定。

每个锚经 J-Lens 拉回残差流。J-Lens 用平均雅可比把中间层映到最终层,再用模型自己的反嵌入矩阵读出。Gemma 4 和 Qwen3.5 用公开镜头。Magistral 1.1 在 100 条 WikiText、序列长度 128 上自估,只做反向传播。不确定锚的重心减去确定锚的重心,两边共有的自信口气被减掉。四根轴正交化,得到这一层的基。

U-Lens 把每个推理 token 的隐藏状态投到这四根轴上,坐标归一化后只留朝向,再用 softplus 折进正锥。某一类上的负对齐不能抵消另一类上的正对齐,几类犹豫可以并存。向量长度记为 Acone,只在 end-of-thinking 读一次。这个状态已经看完整段推理,位置固定,不必把变长轨迹池化一遍。

一阶信号是平均预测熵,看下一步词表有多平。二阶信号是 Acone,看犹豫能不能被说成那四类。这里的一阶、二阶指信心的两层,不是导数。两路相乘,不另学权重。任一路乘一个正的常数,排序不变。读出层锁在深度的三分之二:Gemma 4 第 40/60 层,Qwen3.5 第 42/64 层,Magistral 第 27/40 层。

结果

MMLU-Pro、Omni-MATH、SuperGPQA、TriviaQA 各抽 1000 题,三个种子,每题一条回复。准确率是 Gemma 4 78.8%、Qwen3.5 79.7%、Magistral 1.1 65.0%。AUROC 和 AUPRC 看错答能不能排到前面,AURC 看按分数拒答后剩下的错误率,越低越好。

未控长度时,U-Lens 平均 AUROC 71.1±4.7,AUPRC 45.5±4.2,AURC 16.2±8.3。TokUR 是 69.6 和 16.2,长度是 68.6,最大 softmax 概率是 53.3。

控长度之后,U-Lens 是九组「模型 × 指标」里唯一都排第一的方法。相对各模型最强基线,AUROC 高 2.2、1.9、4.7 个点。论文给出的 AUPRC 提升是 0.8 到 4.2 个点,AURC 下降 0.4 到 2.5 个点。U-Lens 自己只从 71.1 掉了 1.8 个点。

模型U-Lens最强基线预测熵仅 Acone生成长度
Gemma 468.466.2 Feature-Gaps66.166.352.1
Qwen3.571.069.1 DeepConf / Self-Certainty68.966.752.7
Magistral 1.168.363.6 DeepConf62.667.652.3

Qwen3.5 上预测熵更强,68.9 对 Acone 的 66.7。Magistral 上反过来,Acone 67.6,预测熵 62.6。Gemma 4 上两路互有胜负。乘积都高于单独一路。相对预测熵,U-Lens 的 AUROC 高 2.3、2.1、5.7 个点。

线索词只出现在 23% 到 34% 的 Gemma 4 轨迹里,TriviaQA 上只有 4%。没有线索词的 77% 轨迹,控长度 AUROC 仍是 68.6%,全集是 68.4%。拿线索词计数,控长度后明显低于 Acone。再减去确定词出现次数,关键词分数掉到随机以下。

Qwen3.5 答 Hamlet 时,轨迹依次读成信息缺失、歧义、证据冲突和笼统不确定。把歧义方向按状态范数的比例加进推理中段,模型会先怀疑有陷阱,再答 4。预填充时分别推四类方向,「2+2」会被讲成进制或笑话。主文没有给准确率降幅。

附录里换锚读过情绪和奖励黑客。GoEmotions 测试集 5427 条上,愤怒、悲伤、恐惧、负面情绪的 AUROC 为 74.6、76.8、79.8、73.0。作弊轴留出回答 90.2 到 92.6,留出未见手法 91.4 到 96.9,长度基线 59.3 到 60.7。这根轴抓荒唐和装腔,抓不住像样的假引用。

为什么重要

镜头按检查点算一次,之后每条回答只读这一次生成。标量用来拒答,四类坐标标出犹豫属于哪一种。未控长度时,U-Lens 只比 TokUR 高 1.5 个 AUROC,AURC 打平。控掉长度之后,语义熵的跨模型平均只比预测熵高 0.1 个点。相对预测熵,这是去掉长度之后还留下的增量。

看不到残差流的 API 用不上这套基。

局限与存疑

这不是校准过的安全检测器,高风险场合不能代替独立核对。沿同一方向做干预,会改变模型把话说死的程度。

三类差向量的余弦是 0.51、0.60、0.65,分得开,离正交很远。确定端词表夹着表示自信口气的词。锚是英文,多语言锚留作后续。词类划分用了外部编码器,「不训练」只表示被测模型的参数不动。

Acone 随层深变化很大,数字绑在三分之二深度,也绑在 end-of-thinking 标记上。不输出思考轨迹的对话模型没有测。截断和解析失败的输出被丢掉。主表把四项基准平均在一起,看不出哪一类题失效。

Magistral 未控长度时,U-Lens 只有 65.7%,低于长度的 67.8%,也低于 Acone 的 68.5%。控长度后,乘积只比 Acone 高 0.7 个点,68.3 对 67.6。三个模型未控 AUROC 的标准差是 ±4.7,AURC 是 ±8.3。转向实验说明方向能改句子,没有给出可校准的效应量。情绪极点是手挑的 12 个词,只在一个模型上测过。

术语

原文与代码

相关论文

全部论文解读