Scaling Inherently Interpretable Language Models
Guide Labs Team, Andreas Madsen, Aya Abdelsalam Ismail, Giang Nguyen, Isaac Plant, Muawiz Chaudhary, Nathaniel Monson, Saqib Azim, Zhichen Guo, Julius Adebayo
cs.CL, cs.AI
2026-08-06
Steerling-8B 把可解释性焊进训练管线:用 3.3 万概念的加性瓶颈做归因,效果只比多花十几倍算力的同侪差约 10%,规模越大越好懂。
现在的语言模型都是先训一个黑盒,再事后解释:上探针、上特征归因、上稀疏自编码器(SAE)、上思维链。这些工具有用,但有个结构性短板:模型训练时从没被要求让「解释」本身成为一个靠谱的接口。探针能告诉你某信息「可被解码」,不能告诉你模型「真的用了」它;梯度归因测的是局部敏感度,不是「去掉这个特征会怎样」;SAE 重建了激活,但不保证那对应模型计算里的一个真实单元;思维链可能讲了个头头是道的理由,却和真正产生答案的计算无关。Guide Labs 这篇要挑战的,正是「可解释性必然拖累能力」这个前提。
核心思路:把可解释性当作训练管线的约束,和数据、架构、目标函数一起优化,别等训完再补。具体落到一个叫 Steerling-8B 的模型上,三个设计支柱。
第一,概念库。要训一个「按概念分解输出」的模型,先得有一个大规模、人类可懂的概念库,而现成的没有。团队造了 Atlas 管线:从几百万文档里抽出几亿个自由标签,归并成 3.3 万多个规范概念(横跨科技、医学、法律等),再训一个标注器给任意文本按 chunk 打标,总共标了超 1 万亿 token。
第二,架构。Steerling-8B 是个带因果注意力的扩散语言模型。为什么不用自回归?自回归从左到右逐 token 生成,概念往往跨多个 token,且没有一个自然的「此处无信息」基线(而这正是忠实输入归因需要的)。扩散模型的掩码目标解决了这个:[MASK] 就是模型训练时就见过的「无信息」状态,归因有了合法基线;多个 token 在一个去噪步里联合预测,概念级操控有了现成的接口。他们提出 Causal Diffusion:保留分块注意(块内双向、块间因果),但训练时丢掉 Block Diffusion 那套「干净副本加噪声副本」拼接,把训练成本砍掉将近一半,推理时还能像自回归一样复用 KV cache。
第三,概念模块。在 transformer 主干和 LM head 之间插一个加性瓶颈,把隐藏状态 h 拆成 h̄ = k̂ + û + ε:k̂ 是「已知概念」(3.3 万个有标签的)加权和,û 是「未知概念」(模型自己学的,低秩分解省参数)加权和,ε 是残差。因为 LM head 是线性的,任意输出 token 的 logit 精确分解成已知概念、未知概念、残差三部分,没有任何近似。这就让概念归因可以直接读出来,也让概念操控(往某个概念方向加一个向量)变成一个封闭形式的编辑,不需要事后去估方向。
训练目标把扩散语言建模损失、概念损失(chunk 级、只用正样本)、重建损失、独立性损失(逼已知与未知概念别重叠)线性组合,并有 teacher forcing 调度(早期喂真值概念,逐步退火到模型自己的预测,防概念泄漏)。概念模块的参数占比随规模快速下降:10M 时占 89%,8B 时占 4%,前沿规模下不到 1%。
这套结构会不会拖垮能力?作者用 IsoFLOP 扫描(每个计算预算下找最优模型大小)跨三个数量级算力、四个模型族(自回归 AR、因果扩散 CDLM、各自加概念的版本)拟合 scaling law。结论:加概念模块只给计算最优 scaling 指数一个「小的、固定的」偏移,不是随规模增长的税。更意外的是,四个可解释性指标(概念预测准确率、已知与未知表征分离度、概念贡献占比、概念对齐度)全都随算力变好,模型越大反而越好懂。用小模型拟合预测 Steerling-8B 的验证损失,误差在 0.11 nat 以内。
和同规模开源模型的横向对比(7 项基准,都是 base 模型):
| 模型 | MMLU | GSM8K | ARC-C | HellaSwag | 平均 |
| Steerling-8B | 46.4 | 44.4 | 52.3 | 70.3 | 51.6 |
| LLaMA2 7B | 45.9 | 13.1 | 46.3 | 76.0 | 48.2 |
| LLaMA3 8B | 65.4 | 48.7 | 53.1 | 79.1 | 60.0 |
| OLMo 2 7B | 63.7 | 67.5 | 79.8 | 83.8 | 67.3 |
每个对手都用了 Steerling 2 至 16 倍的算力,Steerling-8B 平均落在它们 10% 以内,且优于算力相近的模型。注意它明显弱在 Math(8.0)等基准上:预训练语料(Nemotron-CC-HQ)数学和代码偏少是主因,作者在中训练(mid-training,150B token 的代码与数学增强)里补了,MMLU 涨 17 个百分点、GSM8K 涨 30 个百分点。
这篇动摇的是「要能力就得接受黑盒」这个默认假设。如果可解释性的代价只是一个固定 offset 而非增长税,而且随规模变好,那把它写进训练标准流程就有了经济依据。对做对齐、安全、审计的人来说,一个「归因读出来即真、操控是封闭形式编辑」的模型,比事后探针或 SAE 的「看起来像那么回事」要硬得多。概念库 Atlas 本身(3.3 万概念、标了 1 万亿 token)也是个可复用的资产。要泼的冷水是:Steerling-8B 的绝对能力仍落后头部同规模模型(Math 8.0、平均 51.6 对比 OLMo2 的 67.3),它证明的是「范式可行加代价可控」,不是「今天就能替换主力模型」。
作者自己划了几条线。Steerling-8B 的「固有可解释性」不等于全局机制透明:它保证的是指定归因查询(输入、概念、训练数据三类)的忠实,不是每个神经元都讲得清。训练数据归因用的是表征相似度检索,明确不主张这是因果影响(影响函数那种)。最实在的局限来自训练过程本身:中训练前,Steerling-8B 的概念操控(steering)其实是不灵的,往概念方向注入向量后文本质量明显下降,约三分之一低频概念在任何注入强度下都不激活,因为训练时从没见过这种注入,是分布外扰动;是中训练里专门加了 steering 阶段才救回来的。语料数学与代码不足、掩码调度过激、概念头后期纠缠,都是训完才查出来、靠 mid-training 补的,说明这套配方还远未成熟,很多超参是在 8B 规模上才暴露问题的。横向对比也只对 base 模型、7 项基准,未覆盖对话或指令调优后的真实使用面。