研究者探讨底层架构:稀疏 MLP 或优于线性注意力

独立研究员 kalomaze 近期对当前流行的线性注意力等新兴模型架构提出质疑。他发推探讨了一个反直觉的基线方案:业界似乎很少有人测试过在 90% 的网络层中直接使用基础的 ResNet 或 MLP 来替代注意力机制。他进一步指出,考虑到语言数据的不连续性,梯度下降的稳定性比函数类本身更重要,而稀疏 MLP 或许是一个被忽视的更强基线。

2026-07-30 ~ 2026-07-30 · 4 条相关