研究量化自注意力'有效检索集':少量 token 即可守住模型损失
Timur Mudarisov · hf · 2026-10-01
- 问题:语言模型到底真正使用上下文里的多少 token?作者通过自注意力回答:不重训练,在每个 head/layer/query 上只保留注意力权重最高的 token,通过测量负对数似然(NLL)上升,估算维持损失容差所需的有效注意力集合大小。
- 发现:相对较小的保留集合即可让 NLL 接近全注意力基线,但所需规模因模型而异;基于注意力的选择显著优于随机选择,且保留集合呈现几何结构——但几何可分本身并不保证损失保持。
- 上下文影响:在固定评估目标下扩展上下文会增加所需集合大小,但其占上下文比例在测试范围内下降;固定支撑事实实验显示,额外背景会把相关 token 往下推、降低其注意力质量。
- 聚合的作用:重新归一化保留权重可大幅减少所需集合规模,说明有效集合大小还取决于选中表征如何组合。理论模型解释了竞争与注意力质量保持如何在没有更多可检索信息的情况下仍导致集合增长。
「研究」频道最新
- AI 也能预测气候:新视频讲解天气预测中的机器学习 — ariG23498 · 2026-10-01
- 微软开源 MarS:用 2M~1B 参数模型模拟金融市场行为 — mohamedmansour · 2026-10-01
- 从读到写:合成基因组学三大路线解析重构、重编码与最小化 — melnykowycz · 2026-10-01
- TokShop 第二届 Tokenization Workshop 将于 COLM 2026 举办,征稿进行中 — yuvalpi · 2026-10-01
- OASIS 用已验证轨迹修复自蒸馏缩放失效,8B 模型 AIME 提升 3 分以上 — Md. Ismail Hossain · 2026-10-01
- ATLAS 训练目标保住潜变量几何关系,显著提升世界模型规划成功率 — Ke Fang · 2026-10-01