最大规模实证分析:揭示稀疏注意力的真实权衡与假象
p_nawrot · x · 2026-08-17
新论文《The Sparse Frontier》对训练无关的稀疏注意力方法进行了迄今最大规模的实证分析。作者发现,该领域存在许多“作弊”手段让低效方法在评测中表现良好,但经不住严格审查。
主要发现:
- 有效性:在同等成本下,更大的稀疏模型优于更小的密集模型,扩展了帕累托前沿。
- Prefill 困境:由于估算成本和内核支持缺失,细粒度的逐查询重要性估算在 Prefill 阶段仍不切实际。
- 解码可行性:解码阶段 token-to-page 选择变得可行,能更好地泛化并容忍更高的稀疏度。
- 序列长度:更长的序列能容忍更高的稀疏度,建议生产环境放弃固定预算方法,采用稀疏度随序列长度增加的策略。
所属事件:稀疏注意力评测被指注水,实证研究揭真实权衡(3 条相关)→
「Infra」频道最新
- QVM 支持超低延迟桌面流,适配三大系统 — OwariDa · 2026-08-17
- Groq 融资 3.5 亿美元,估值达 35 亿美元 — dinabass · 2026-08-17
- llama.cpp 发布 v0.1.0 版本,启用语义化控制 — Warrenio · 2026-08-17
- Mac Studio 上实测 DeepSeek V4 Flash:质量惊艳 — pj-frey · 2026-08-17
- 社区讨论:EXL3 因缺乏 RAM 溢出支持而热度减退 — silenceimpaired · 2026-08-17
- 美数据中心陷电力瓶颈,SpaceX 拟推星链算力破局 — XFreeze · 2026-08-17