混合架构 LLM 训练后仍依赖注意力,辅助损失让循环记忆派上用场
mohitban47 · x · 2026-10-07
新研究探讨混合 LLM(Qwen3.5、Nemotron-H 等同时具备注意力与循环记忆的架构)是否真的学会使用两条记忆通路:
- 发现:即使经过 SFT,模型仍严重依赖注意力,循环记忆通路被闲置
- 方法:引入一个简单的辅助损失,训练时强制过去信息经过循环通路传递
- 效果:问答任务平均提升 4.6%,agentic 任务平均提升 12.1%,长上下文收益更大;在多种记忆类型的注意力模型上提升 28.6%
- 结论:拥有多条记忆通路只是问题的一半,模型还需要被教会有效使用它们
结果在多个混合 LLM 上均具泛化性。
所属事件:研究:混合架构 LLM 几乎只用注意力,辅助损失唤醒循环记忆(4 条相关)→
「模型」频道最新
- OpenAI 推出 Decisions API 公测:比 GPT-6 Luna 快 10 倍替应用做决策 — OpenAIDevs · 2026-10-07
- Cloudflare 开源视觉决策模型 clef,速度惊艳引热议 — michellechen · 2026-10-07
- 团队实测 OpenAI Decisions API:网页质量过滤 AUPRC 达 88.8% — OpenAIDevs · 2026-10-07
- 观察:西方实验室更少从 Claude 蒸馏,却更倾向蒸馏 GLM 5.3 — andrew_n_carr · 2026-10-07
- OpenAI Luna 后开源模型性价比讨论遇冷,博主自嘲用 GPU 余热取暖 — BLUECOW009 · 2026-10-07
- V4.1 Flash 评测:Flash 梯队最强,但幻觉忽好忽坏像开盲盒 — teortaxesTex · 2026-10-07