Hugging Face新论文提出将可解释性作为训练约束

Hugging Face 发布的最新学术论文挑战了“可解释性是模型能力负担”的传统认知。该研究提出了一种新范式:不再将大模型视为黑盒进行事后解释,而是将可解释性直接作为训练流水线的约束条件,与语言建模目标共同优化。实验表明,在跨越三个数量级的计算规模上,可解释性能与模型能力实现同步扩展。团队还发布了实例模型以供社区研究。

2026-08-11 ~ 2026-08-11 · 2 条相关