研究发现混合架构 LLM 过度依赖注意力,激发循环记忆问答提升 4.6%
EliasEskin · x · 2026-10-07
一项针对注意力-循环混合架构 LLM(如 Qwen3.5)的研究发现:
- 问题:混合模型拥有注意力与循环两条互补的记忆通路,但实际上严重偏向注意力,即便经过 SFT 之后依然如此,循环记忆通路未被有效利用
- 方法:通过训练手段鼓励模型使用循环记忆
- 结果:长上下文任务上表现尤其改善,问答任务平均提升 4.6%,agentic 任务平均提升 12.1%;在带多种记忆类型的 attention-only 模型上最高提升 28.6%
- 在多个混合 LLM 上均展现了良好泛化性
结论:混合架构的潜力远未榨干,显式引导循环记忆的使用是低成本涨分方向。
「研究」频道最新
- 数学家谈 LLM 使用规范:过渡期无共识,抢首发难获认可 — littmath · 2026-10-07
- WIRED:OpenAI 拟一次性公开上百道数学难题解答,惹恼数学界 — nordicinst · 2026-10-07
- IdeaLens:不只查 AI 文笔,还能分辨文章「想法」来自人还是 AI — MohitIyyer · 2026-10-07
- AAAI'27 将办 SC4AI 研讨会:用社会选择理论做 AI 对齐 — conitzer · 2026-10-07
- 权重移植新发现:mid-training 可在 RL 后再叠加,对齐照样生效 — repligate · 2026-10-07
- WonderSearch 1.1 发布:查询期智能检索,称 7 项稀疏检索基准全第一 — Scobleizer · 2026-10-07