U-Space:用机制可解释性找到 LLM 内部「不确定子空间」,无需训练可测信心
Tobias Braun · hf · 2026-10-09
这篇 HF 论文提出 U-Space,一个低维子空间,让语言模型推理过程中的不确定性演变变得可测量、可解释:
- 动机:LLM 常以流畅自信的口吻给出错误结论;现有不确定性量化方法多需重复生成或单独训练组件,且标量分数无法揭示不确定性从何而来、如何在推理中演化
- 方法:识别「怀疑」与「确定」的语义锚点,将其 unembedding 方向映射回残差空间,组合成正交基;U-Lens 把每个 token 状态投影到该基上,得到可解释的 token 级不确定性图,可聚合为标量分数
- 优势:无需正确性标签、无需重复生成、无需训练;在推理基准上,其置信分数在标准与长度控制评估下均优于既有基线,迁移性也优于监督式估计器,并回应了「分数只是反映输出长度」的质疑
代码已开源:github.com/s2labres/U-Space。
「研究」频道最新
- 博客长文把激活函数拆成骨架:斜率曲率饱和度如何决定梯度与可训练性 — CatAstro_Piyush · 2026-10-09
- 编码 Agent 别只用扁平上下文窗口:分类型上下文面架构 — Puzzleheaded_Box2842 · 2026-10-09
- SDF 碰撞检测新方法:缓存+重要性采样,数千刚体实时仿真 — Michael_Moroz_ · 2026-10-09
- 新论文提出 Sensitivity AOV:让可微渲染的导数像图像一样可视化和合成 — ssh4net · 2026-10-09
- AI 药物进入临床后期:三款 AI 设计药物推进 II/III 期试验 — FinanceYF5 · 2026-10-09
- 数学证明 Transformer 计算通用,但标准优化器找不到最优点 — Promptmethus · 2026-10-09