Extender:日志式改造 Transformer,注意力内存直降 104 倍
UIChicago · hf · 2026-10-06
论文提出 Extender——标准 Transformer 的 log-structured 变体。
- 核心改动:在残差通道 h 之外新增一个拼接通道 x,每层输出残差更新 δ 与一个更小的扩展 ε,ε 追加到 x;注意力 KV 投影只吃 x。
- 效果:持久注意力内存从 2L·dmodel 降到各层 ε 之和。取 |ε|=32 时,在 199M–924M 参数规模上,CORE 短上下文任务与 Transformer 持平,RULER 长上下文任务反超。
- 924M(d=1664)模型上,持久注意力内存比标准 MHA 小 104 倍,且模型越宽节省越多。
「研究」频道最新
- UCLA 博士用 LLM agent 63 天产出 12.6 万行 Lean 4 机检证明 — siyan_zhao · 2026-10-06
- UniReps 第四届研讨会落地巴黎,投稿截止延至 10 月 10 日 — ClementineDomi6 · 2026-10-06
- 为单一负载定制架构:AI 生成的 KV 存储如何超越通用数据库 — CShorten30 · 2026-10-06
- Real2sim 进机器人评测还有最后一英里:验证管线补齐物理与可供性 — chris_j_paxton · 2026-10-06
- LenVM 入选 COLM 2026 Spotlight:用价值模型预测生成长度省算力 — xwang_lk · 2026-10-06
- 实测20余种让廉价编码模型变强的方法:强模型「良心监督」性价比最高 — KangarooAnxious9394 · 2026-10-06