论文揭示混合Transformer中的巨大激活值现象

rohanpaul_ai · x · 2026-08-18

针对新兴的混合 Transformer 架构(用廉价循环层替代部分注意力层)的研究发现,模型在剩余的少数昂贵注意力层前会出现异常巨大的内部激活值。在对 Qwen3.5、Kimi Linear、Nemotron-H 和 Zamba2 的测试中,这种“预注意力峰值”现象普遍存在。研究表明,虽然保留少数全注意力层是为了节省算力,但这些层对模型行为的影响远超其数量比例,是架构设计的关键。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →