注意力头间互通的 IHA 被 NeurIPS 接收,RULER 检索提升 10-20%
_arohan_ · x · 2026-10-01
Interleaved Head Attention (IHA) 被 NeurIPS 2026 接收,作者团队包括 Sai Surya Duvvuri、Chanakya Ekbote、Inderjit Dhillon 等,Arohan 撰文祝贺。
- 动机:标准多头注意力中各头彼此隔离,跨头组合关系只能靠后续层堆叠完成,不利于多步推理。
- 方法:IHA 为每个头构造 P 个伪头(通常 P=H),每个伪 query/key/value 是全部 H 个原始 q/k/v 的学习线性组合,从而在注意力计算前实现头间通信;每头可产生多达 P² 种注意力模式,参数开销仅 O(H²P)。
- 理论:在合成 Polynomial 任务上参数量从 Θ(kn²) 降至 Θ(√k·n²);在 order-sensitive 的 CPM-3 任务上头数从 Nmax 降至 ⌈√Nmax⌉。
- 实验:RULER 多键检索提升 10-20%(4k-16k 上下文);在 OpenThoughts 上微调推理后,GSM8K 提升 5.8%,MATH-500 多数投票提升 2.8%。
「模型」频道最新
- BuildingBench 榜单:GPT-6.1 Sol 得 85.1 分,成本仅 Opus 5.5 的 1/27 — ZhitingHu · 2026-10-01
- Gemini 3.8 Flash 高配版 WeirdML v2 拿 84.8%,首超 Gemini 3.1 Pro — teortaxesTex · 2026-10-01
- GLM 5.3 Flash 重写内核上线 RunInfra:670 tok/s、缓存命中率 99.7% — ycombinator · 2026-10-01
- 再次得手:研究者宣称提取到 GPT-6 Astra 原始推理痕迹 — maksym_andr · 2026-10-01
- Fireworks 发布 Ember-1:基于 Kimi K3,更少 token 性能持平 — sophiamyang · 2026-10-01
- Anthropic AI 攻克渗流理论数十年悬案,数学家称媲美菲尔兹奖级工作 — Dr_Singularity · 2026-10-01