研究:注意力非线性催生幂律 massive activation 与 scaling law
burny_tech · x · 2026-10-02
研究者提出注意力机制与神经 scaling law 这两大 LLM 成功支柱之间存在深层联系:Transformer 为聚焦特定 token 所需的非线性,会自然产生幂律形式的「massive activation」(个别特征激活值异常巨大)以及幂律形式的 loss 下降曲线。
换言之,模型对关键 token 的注意力集中方式与其随训练规模提升的规律,可能由同一套数学机制驱动,为理解 scaling law 的起源提供了新视角。
「研究」频道最新
- 向量搜索拆成四步:从编码到点积排序的完整原理 — techNmak · 2026-10-02
- 计算正确≠科学发现:Anthropic 文章反思 AI 科研助手边界 — Crescitaly · 2026-10-02
- 转推 Chollet:transduction 记答案,induction 学程序,推理模型押注后者 — sebpaquet · 2026-10-02
- NVIDIA 论文:任务越长模型越马虎,128K 长任务准确率平均降 62.8% — rohanpaul_ai · 2026-10-02
- HGR 框架用高阶文法序列化分子拓扑,生成Validity 100% — CatAstro_Piyush · 2026-10-02
- Meta 研究提出 Sharpening Tax:后训练提升首试精度却收窄解空间 — iScienceLuvr · 2026-10-02