Steerling-8B:训练时植入可解释性的扩散模型

burny_tech · x · 2026-08-20

Guide Labs 发布论文《Scaling Inherently Interpretable Language Models》及 Steerling-8B 模型。不同于传统先训练后解释,该方法将可解释性作为约束条件直接融入训练流程。实验表明,随着规模扩大,模型内部表征反而更加解耦且符合人类概念。Steerling-8B 支持概念归因与闭环干预,无需重新训练即可纠正行为,在较少算力下性能可媲美开源竞品。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →