单次前向传播追溯 LLM 训练数据:设计即归因的新方法亮相 COLM

juliusadml · x · 2026-10-06

一篇 COLM 论文提出「设计即归因」(training data attribution by design) 的思路:传统事后归因方法难以满足的结构性质,可以通过改变模型训练方式直接施加。核心机制是让每个 token 只激活一组稀疏原型 (prototypes),使原型空间中的 Hessian 继承训练数据上的原型共激活结构;作者通过聚类目标定位这些交互并改善条件数,让影响 (influence) 的计算大幅变容易,单次前向传播即可把模型输出追溯到训练数据。作者将在 COLM Poster Session 1 现场讲解。

所属事件:COLM 论文提出 PRISM:前向传播即可追溯训练数据(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →