PRISM:一次前向传播即可追溯LLM输出到训练数据
juliusadml · x · 2026-10-06
PRISM(Prototype Language Models)是一类让语言模型的 next token 预测在单次前向传播中即可追溯到预训练数据的原型模型。作者将在 COLM 的 Poster Session 1 展示这项工作,目标是让模型输出的来源可解释、可审计,而不是黑盒生成。
所属事件:COLM 论文提出 PRISM:前向传播即可追溯训练数据(3 条相关)→
「研究」频道最新
- AI 数学证明走向开源式协作:方格装箱证明附可视化讲解 — ctjlewis · 2026-10-07
- 开源平台 Overmind:用生产轨迹持续训练与改进 AI Agent — cneuralnetwork · 2026-10-07
- 仅凭 top-20 logits 约 100 次查询即可恢复未询问属性 — sineadwilliamso · 2026-10-07
- 研究发现:top-k logits 泄露的信息量与 tuned lens 相当 — sineadwilliamso · 2026-10-07
- AutoAWQ 作者:约 4.3 万美元和一个 B300 节点四周可复现 Bonsai 2 — airesearch12 · 2026-10-07
- COLM 2026 新研究:下游任务早接触统一安全预训练视角 — AdtRaghunathan · 2026-10-07