Guidelabs:可解释性应内建于训练过程而非事后补救

jefrankle · x · 2026-07-31

Guidelabs 联合创始人兼 CEO Julius Adml 在访谈中提出,可靠的可解释性应当在模型训练过程中构建,而不是在训练完成后试图去解释数十亿参数学到了什么。

目前业界大多采用“先训练,后解释”的方式。Guidelabs 则采用了一种不同的方法,构建了扩散语言模型,旨在将输出结果追溯到其上下文、影响概念以及背后的训练数据。

Adml 基于其博士研究挑战了“可解释性会牺牲性能”的传统假设。他认为,在训练大型神经网络时对其进行约束,依然可以使其性能与未受约束的模型相媲美。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →