为何没人测过用 ResNet MLP 替代大部分注意力层?
kalomaze · x · 2026-07-30
开发者 @kalomaze 提出一个反直觉的模型架构疑问:业界一直在探索线性注意力或 Mamba 等 RNN 变体来替代注意力机制,但似乎很少有人测试过一个极其简单的基线方案——在 80% 以上的网络层中使用最基础的 ResNet MLP,仅在剩余部分保留 Softmax 注意力机制。
所属事件:研究者提议用基础 MLP 替代注意力机制(3 条相关)→
「研究」频道最新
- 探讨架构创新:梯度下降的稳定性比函数类更重要 — kalomaze · 2026-07-30
- Harness 实测:保留推理过程并压缩,模型指标提升 3 倍 — oran_ge · 2026-07-30
- 探讨混合架构模型:复杂线性层或可蒸馏为极简形态 — kalomaze · 2026-07-30
- 模型爱拿"模拟"当借口?AI对齐研究揭示越狱新挑战 — DKokotajlo · 2026-07-30
- YC Paper Club 深度解析:多 GPU 内核优化与本地推理的能效比 — Y Combinator · 2026-07-30
- 探讨智能本质:FFT注意力机制与全局连贯性 — tallmetommy · 2026-07-30