研究揭示混合架构 LLM 几乎只用注意力,辅助训练可逼出循环记忆价值
mohitban47 · x · 2026-10-07
新研究发现 Qwen3.5、Nemotron-H 等注意力-循环混合架构模型虽然有两套记忆通路,但实践中几乎完全依赖注意力。
关键发现
- 屏蔽注意力通路后准确率从 30% 崩到 5%;屏蔽循环通路仅降到 20%,损伤有限
- 标准 SFT 只会进一步加剧这种失衡
修复方法
- 设计一个辅助训练 pass:让注意力看不到过去,迫使模型依赖循环记忆
- 整体性能提升,问答任务平均提升 4.6%,agentic 任务平均提升 12.1%
- 注意力专用模型配合多记忆类型提升高达 28.6%
- 在长上下文、多证据问答和长程 agent 任务上收益最明显,且保留了注意力的使用
所属事件:研究:混合架构 LLM 几乎只用注意力,辅助损失唤醒循环记忆(4 条相关)→
「研究」频道最新
- GroundedSLAM 发布:大幅刷新 Meta 第一人称 SLAM 基准 — Scobleizer · 2026-10-07
- HCI 学者吐槽:别把归纳式主题分析冒充「反身性」分析 — IanArawjo · 2026-10-07
- Reza Zadeh 称找到更快矩阵乘法算法,猜测大厂已接近指数 2 — Reza_Zadeh · 2026-10-07
- Reddit 网友提出图式确定性建模,解决 LLM 金融计算不可信难题 — jonnylegs · 2026-10-07
- COLM 2026 海报:面向智能体编程的测试时算力扩展研究亮相 — dan_fried · 2026-10-07
- COLM 2026 高效推理研讨会周五举行,含分论坛讨论 — tydsh · 2026-10-07