新论文挑战传统认知:可解释性可与 LLM 能力同步扩展

andreas_madsen · x · 2026-08-11

一篇最新学术论文挑战了「可解释性是对模型能力的负担」这一传统观念。研究者将可解释性作为训练流程的约束条件,与语言建模目标共同优化。

实验表明,在三个数量级的计算规模上,可解释性能够与模型能力同步扩展,而非相互冲突。令人意外的是,随着模型规模扩大,其表征变得更加解耦,且更符合人类可理解的概念。

研究团队推出了扩散语言模型 Steerling-8B。该模型能为生成的输出标记归因到相关的输入标记、人类可理解的概念和训练数据,从而实现闭环干预:通过概念归因诊断输出,检索相似的训练数据,并通过概念引导纠正行为,全程无需重新训练。

所属事件:Hugging Face新论文提出将可解释性作为训练约束(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →