论文揭示混合Transformer中的巨大激活值现象
rohanpaul_ai · x · 2026-08-18
针对新兴的混合 Transformer 架构(用廉价循环层替代部分注意力层)的研究发现,模型在剩余的少数昂贵注意力层前会出现异常巨大的内部激活值。在对 Qwen3.5、Kimi Linear、Nemotron-H 和 Zamba2 的测试中,这种“预注意力峰值”现象普遍存在。研究表明,虽然保留少数全注意力层是为了节省算力,但这些层对模型行为的影响远超其数量比例,是架构设计的关键。
「模型」频道最新
- 用户实测 Codex 消耗暴增:半天烧掉 15% 周额度 — GabGarrett · 2026-08-18
- Qwen3.8-Max 惊现零样本实例分割能力 — iamrobotbear · 2026-08-18
- 曝 OpenAI 新模型 Astra 拟周四发布,能力达 AGI 级别 — VraserX · 2026-08-18
- antirez:别把 Artificial Analysis 榜单当 LLM 全部真相 — antirez · 2026-08-18
- 新基准 Connections Eval 榜单:Grok 暂居首 — aronchick · 2026-08-18
- 业界批评:模型评测正在沦为「质量洗白」工具 — cocktailpeanut · 2026-08-18