研究者质疑线性注意力必要性:稀疏MLP或为更强基线
kalomaze · x · 2026-07-30
独立研究员 kalomaze 对当前流行的新兴架构(如线性注意力或 Mamba 类 RNN)提出了质疑。他发推探讨:考虑到语言数据本身的不连续性,如果线性注意力机制在中间 token 上的表达增益仅仅相当于简单的向量插值,那么它究竟带来了什么超越稀疏 MLP 的实质优势?
他进一步指出,目前业界似乎普遍忽略了一个极其基础且重要的基线测试:如果在 80% 以上的网络层中使用最基础的残差 MLP,仅在剩余少量层使用 softmax 注意力机制,模型表现会如何?他认为很多新架构的所谓优势,可能仅仅是因为这种基础组合没有被广泛测试过。此外,他还补充道,架构的有效性很大程度上取决于“梯度下降能否在特定的架构形状下正常工作”,这与“函数类本身是否有用”是完全不同的问题。
所属事件:研究员提议用极简MLP替代多数注意力层作基线(5 条相关)→
「研究」频道最新
- 合成数据何时有效?研究揭示其最佳配比与“Zeta定律” — PTenigma · 2026-07-30
- 将Jacobian方法用于大模型对比转向,效果优于传统控制 — voooooogel · 2026-07-30
- ICML论文:二次模型竟能精准描述LLM预训练 — jasondeanlee · 2026-07-30
- Lean是《数学原理》的终极回响?论形式化验证的哲学分野 — doodlestein · 2026-07-30
- Meta 与 CMU 论文:将上下文压缩变为智能体动作,长程任务表现提升 27% — rohanpaul_ai · 2026-07-30
- 半导体量子计算潜力探讨:比特数需比肩经典晶体管 — whurley · 2026-07-30