Hugging Face 新论文:将可解释性作为训练约束,扩散模型随规模增大更易懂

guidelabs · hf · 2026-08-11

传统大模型通常是先作为黑盒训练,再事后进行逆向解释。该研究提出了一种新范式:将可解释性直接作为训练流水线的约束条件,与语言建模目标共同优化。

团队发布了实例模型 Steerling-8B(带有因果注意力掩码的扩散语言模型)。实验表明,在跨越三个数量级的算力规模下,模型的可解释性会随规模的增大而提升,其表征会变得更解耦且更符合人类可理解的概念,而非相互冲突。

此外,Sterling-8B 能够将生成结果直接归因于输入 token、人类概念和训练数据,从而实现闭环干预:诊断输出特征、检索相似训练数据,并通过概念引导纠正行为,无需重新训练。尽管内置了可解释性,该模型在性能上依然能与消耗其 2-16 倍算力的开源模型相竞争。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →