深度注意力坍缩论文:32 层模型约四分之一层已“死”

ziv_ravid · x · 2026-10-01

一篇关于深度注意力坍缩(deep attention collapse)的论文引发研究者讨论。关键发现来自 Block AttnRes 指标:它在 20 层左右达到峰值后开始变差;在最浅的几层里,深度混合几乎不赋予层自身输出任何权重,等于这些层只是在“重新读 embedding”。

实验显示 L=16/24/32 的模型分别出现 2、5、8 个死层——到 32 层时,网络中约四分之一的层已失效。Inheritune 作者 zivravid 评论称这与他们“保留大模型早期层、训练小模型”的思路接近,并抛出开放问题:这些层能否被压缩、该丢弃还是融合,以及该方法能否随规模扩展。

所属事件:研究称深度模型存在注意力坍缩 近四分之一层变死层(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →