Steerling-8B:把可解释性焊进训练,仍追到同侪九成水平

Scaling Inherently Interpretable Language Models

Guide Labs Team, Andreas Madsen, Aya Abdelsalam Ismail, Giang Nguyen, Isaac Plant, Muawiz Chaudhary, Nathaniel Monson, Saqib Azim, Zhichen Guo, Julius Adebayo

cs.CL, cs.AI

2026-08-06

Steerling-8B 把可解释性焊进训练管线:用 3.3 万概念的加性瓶颈做归因,效果只比多花十几倍算力的同侪差约 10%,规模越大越好懂。

这篇在解决什么

现在的语言模型都是先训一个黑盒,再事后解释:上探针、上特征归因、上稀疏自编码器(SAE)、上思维链。这些工具有用,但有个结构性短板:模型训练时从没被要求让「解释」本身成为一个靠谱的接口。探针能告诉你某信息「可被解码」,不能告诉你模型「真的用了」它;梯度归因测的是局部敏感度,不是「去掉这个特征会怎样」;SAE 重建了激活,但不保证那对应模型计算里的一个真实单元;思维链可能讲了个头头是道的理由,却和真正产生答案的计算无关。Guide Labs 这篇要挑战的,正是「可解释性必然拖累能力」这个前提。

方法

核心思路:把可解释性当作训练管线的约束,和数据、架构、目标函数一起优化,别等训完再补。具体落到一个叫 Steerling-8B 的模型上,三个设计支柱。

第一,概念库。要训一个「按概念分解输出」的模型,先得有一个大规模、人类可懂的概念库,而现成的没有。团队造了 Atlas 管线:从几百万文档里抽出几亿个自由标签,归并成 3.3 万多个规范概念(横跨科技、医学、法律等),再训一个标注器给任意文本按 chunk 打标,总共标了超 1 万亿 token。

第二,架构。Steerling-8B 是个带因果注意力的扩散语言模型。为什么不用自回归?自回归从左到右逐 token 生成,概念往往跨多个 token,且没有一个自然的「此处无信息」基线(而这正是忠实输入归因需要的)。扩散模型的掩码目标解决了这个:[MASK] 就是模型训练时就见过的「无信息」状态,归因有了合法基线;多个 token 在一个去噪步里联合预测,概念级操控有了现成的接口。他们提出 Causal Diffusion:保留分块注意(块内双向、块间因果),但训练时丢掉 Block Diffusion 那套「干净副本加噪声副本」拼接,把训练成本砍掉将近一半,推理时还能像自回归一样复用 KV cache。

第三,概念模块。在 transformer 主干和 LM head 之间插一个加性瓶颈,把隐藏状态 h 拆成 h̄ = k̂ + û + ε:k̂ 是「已知概念」(3.3 万个有标签的)加权和,û 是「未知概念」(模型自己学的,低秩分解省参数)加权和,ε 是残差。因为 LM head 是线性的,任意输出 token 的 logit 精确分解成已知概念、未知概念、残差三部分,没有任何近似。这就让概念归因可以直接读出来,也让概念操控(往某个概念方向加一个向量)变成一个封闭形式的编辑,不需要事后去估方向。

训练目标把扩散语言建模损失、概念损失(chunk 级、只用正样本)、重建损失、独立性损失(逼已知与未知概念别重叠)线性组合,并有 teacher forcing 调度(早期喂真值概念,逐步退火到模型自己的预测,防概念泄漏)。概念模块的参数占比随规模快速下降:10M 时占 89%,8B 时占 4%,前沿规模下不到 1%。

结果

这套结构会不会拖垮能力?作者用 IsoFLOP 扫描(每个计算预算下找最优模型大小)跨三个数量级算力、四个模型族(自回归 AR、因果扩散 CDLM、各自加概念的版本)拟合 scaling law。结论:加概念模块只给计算最优 scaling 指数一个「小的、固定的」偏移,不是随规模增长的税。更意外的是,四个可解释性指标(概念预测准确率、已知与未知表征分离度、概念贡献占比、概念对齐度)全都随算力变好,模型越大反而越好懂。用小模型拟合预测 Steerling-8B 的验证损失,误差在 0.11 nat 以内。

和同规模开源模型的横向对比(7 项基准,都是 base 模型):

模型MMLUGSM8KARC-CHellaSwag平均
Steerling-8B46.444.452.370.351.6
LLaMA2 7B45.913.146.376.048.2
LLaMA3 8B65.448.753.179.160.0
OLMo 2 7B63.767.579.883.867.3

每个对手都用了 Steerling 2 至 16 倍的算力,Steerling-8B 平均落在它们 10% 以内,且优于算力相近的模型。注意它明显弱在 Math(8.0)等基准上:预训练语料(Nemotron-CC-HQ)数学和代码偏少是主因,作者在中训练(mid-training,150B token 的代码与数学增强)里补了,MMLU 涨 17 个百分点、GSM8K 涨 30 个百分点。

为什么重要

这篇动摇的是「要能力就得接受黑盒」这个默认假设。如果可解释性的代价只是一个固定 offset 而非增长税,而且随规模变好,那把它写进训练标准流程就有了经济依据。对做对齐、安全、审计的人来说,一个「归因读出来即真、操控是封闭形式编辑」的模型,比事后探针或 SAE 的「看起来像那么回事」要硬得多。概念库 Atlas 本身(3.3 万概念、标了 1 万亿 token)也是个可复用的资产。要泼的冷水是:Steerling-8B 的绝对能力仍落后头部同规模模型(Math 8.0、平均 51.6 对比 OLMo2 的 67.3),它证明的是「范式可行加代价可控」,不是「今天就能替换主力模型」。

局限与存疑

作者自己划了几条线。Steerling-8B 的「固有可解释性」不等于全局机制透明:它保证的是指定归因查询(输入、概念、训练数据三类)的忠实,不是每个神经元都讲得清。训练数据归因用的是表征相似度检索,明确不主张这是因果影响(影响函数那种)。最实在的局限来自训练过程本身:中训练前,Steerling-8B 的概念操控(steering)其实是不灵的,往概念方向注入向量后文本质量明显下降,约三分之一低频概念在任何注入强度下都不激活,因为训练时从没见过这种注入,是分布外扰动;是中训练里专门加了 steering 阶段才救回来的。语料数学与代码不足、掩码调度过激、概念头后期纠缠,都是训完才查出来、靠 mid-training 补的,说明这套配方还远未成熟,很多超参是在 8B 规模上才暴露问题的。横向对比也只对 base 模型、7 项基准,未覆盖对话或指令调优后的真实使用面。

术语

原文与代码

社区讨论

相关论文

全部论文解读