研究者探讨底层架构:稀疏 MLP 或优于线性注意力
独立研究员 kalomaze 近期对当前流行的线性注意力等新兴模型架构提出质疑。他发推探讨了一个反直觉的基线方案:业界似乎很少有人测试过在 90% 的网络层中直接使用基础的 ResNet 或 MLP 来替代注意力机制。他进一步指出,考虑到语言数据的不连续性,梯度下降的稳定性比函数类本身更重要,而稀疏 MLP 或许是一个被忽视的更强基线。
2026-07-30 ~ 2026-07-30 · 4 条相关
- 研究者质疑:90% 层用基础 MLP 仅靠残差混合信息可行吗? — kalomaze · 2026-07-30
- 为何没人测过用 ResNet MLP 替代大部分注意力层? — kalomaze · 2026-07-30
- 研究者质疑线性注意力必要性:稀疏MLP或为更强基线 — kalomaze · 2026-07-30
- 探讨架构创新:梯度下降的稳定性比函数类更重要 — kalomaze · 2026-07-30