单次前向传播追溯 LLM 训练数据:设计即归因的新方法亮相 COLM
juliusadml · x · 2026-10-06
一篇 COLM 论文提出「设计即归因」(training data attribution by design) 的思路:传统事后归因方法难以满足的结构性质,可以通过改变模型训练方式直接施加。核心机制是让每个 token 只激活一组稀疏原型 (prototypes),使原型空间中的 Hessian 继承训练数据上的原型共激活结构;作者通过聚类目标定位这些交互并改善条件数,让影响 (influence) 的计算大幅变容易,单次前向传播即可把模型输出追溯到训练数据。作者将在 COLM Poster Session 1 现场讲解。
所属事件:COLM 论文提出 PRISM:前向传播即可追溯训练数据(3 条相关)→
「研究」频道最新
- AI 数学证明走向开源式协作:方格装箱证明附可视化讲解 — ctjlewis · 2026-10-07
- 开源平台 Overmind:用生产轨迹持续训练与改进 AI Agent — cneuralnetwork · 2026-10-07
- 仅凭 top-20 logits 约 100 次查询即可恢复未询问属性 — sineadwilliamso · 2026-10-07
- 研究发现:top-k logits 泄露的信息量与 tuned lens 相当 — sineadwilliamso · 2026-10-07
- AutoAWQ 作者:约 4.3 万美元和一个 B300 节点四周可复现 Bonsai 2 — airesearch12 · 2026-10-07
- COLM 2026 新研究:下游任务早接触统一安全预训练视角 — AdtRaghunathan · 2026-10-07