研究发现混合 LLM 微调后忽视循环通路,掩码注意力可提升长上下文 4.6%
mohitban47 · x · 2026-10-07
新一代混合 LLM(如 Qwen-3.5)在注意力层之外混合了循环层,但研究者发现:直接做 SFT 会让模型几乎忽略循环通路、过度依赖注意力——而两条通路各有所长:注意力擅长大海捞针式精确检索,循环状态擅长聚合分布在整个长上下文中的信息。
修复方法是在微调时做第二次前向传播:屏蔽注意力层使其无法看到此前上下文,只让循环层看到完整序列,并施加标准 next-token 损失,迫使模型学会使用循环状态。
效果显著:
- 长上下文问答平均提升 4.6%
- agentic 任务平均提升 12.1%
- 在只有注意力但含多种记忆的模型上提升 28.6%
- 且在多个混合 LLM 上泛化良好
所属事件:研究:混合架构 LLM 几乎只用注意力,辅助损失唤醒循环记忆(4 条相关)→
「研究」频道最新
- 哈佛发布智能体血液生物标志物发现工具:隐私不出域,AUC 中位提升 4.18 点 — Harvard · 2026-10-07
- LLM 数值线性代数综述:从 QR 算法到支撑大模型的矩阵方法 — Abdelkader Baggag · 2026-10-07
- MEMOIR-VLM 论文:结合脑扫描与临床评分,痴呆分类准确率 91.3% — PTenigma · 2026-10-07
- Claude 解数学问题引争议:提问者是 Anthropic 员工,作者自称「消化者」 — analisereal · 2026-10-07
- ChipForge 芯片设计挑战赛上线:众包设计 AI 加速器并上真硬件 — bittingthembits · 2026-10-07
- SIGGRAPH Asia 2026 公布三位主讲:迪士尼首席科学家、华为图形架构师等 — AlexTensor · 2026-10-07