研究发现混合 LLM 微调后忽视循环通路,掩码注意力可提升长上下文 4.6%

mohitban47 · x · 2026-10-07

新一代混合 LLM(如 Qwen-3.5)在注意力层之外混合了循环层,但研究者发现:直接做 SFT 会让模型几乎忽略循环通路、过度依赖注意力——而两条通路各有所长:注意力擅长大海捞针式精确检索,循环状态擅长聚合分布在整个长上下文中的信息。

修复方法是在微调时做第二次前向传播:屏蔽注意力层使其无法看到此前上下文,只让循环层看到完整序列,并施加标准 next-token 损失,迫使模型学会使用循环状态。

效果显著:

所属事件:研究:混合架构 LLM 几乎只用注意力,辅助损失唤醒循环记忆(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →