深度注意力坍缩论文:32 层模型约四分之一层已“死”
ziv_ravid · x · 2026-10-01
一篇关于深度注意力坍缩(deep attention collapse)的论文引发研究者讨论。关键发现来自 Block AttnRes 指标:它在 20 层左右达到峰值后开始变差;在最浅的几层里,深度混合几乎不赋予层自身输出任何权重,等于这些层只是在“重新读 embedding”。
实验显示 L=16/24/32 的模型分别出现 2、5、8 个死层——到 32 层时,网络中约四分之一的层已失效。Inheritune 作者 zivravid 评论称这与他们“保留大模型早期层、训练小模型”的思路接近,并抛出开放问题:这些层能否被压缩、该丢弃还是融合,以及该方法能否随规模扩展。
所属事件:研究称深度模型存在注意力坍缩 近四分之一层变死层(2 条相关)→
「研究」频道最新
- Gemini 3.8 Flash 高配版 WeirdML v2 拿 84.8%,首超 Gemini 3.1 Pro — teortaxesTex · 2026-10-01
- 研究:加密思维链可跨会话重放,窃取 Claude/OpenAI/Google 前沿模型隐藏推理 — maksym_andr · 2026-10-01
- 从几何视角理解 ML:ReLU、LayerNorm、LoRA 与向量量化的统一直觉 — techNmak · 2026-10-01
- Foresight 旧金山举办 AI for Science 研讨会,DeepMind 等 AI 大咖云集 — juanbenet · 2026-10-01
- 伦敦 AI×科学黑客松 10 月开跑,欢迎不会写码的实验科学家 — ersatzben · 2026-10-01
- Nature 论文发布首个超人 Stratego AI,靠 RL 与测试时计算取胜 — zicokolter · 2026-10-01