技术圈拆解新模型架构:弃用卷积换 Muon,视觉 token 用 3x3 unshuffle

stochasticchasm · x · 2026-09-11

研究者围绕某新开源模型的架构细节展开讨论:多模态的引入相当克制,主要由 backbone 处理视觉 token,而非复杂适配器;其中 3x3 pixel unshuffle 比常见的 2x2 更激进。

另一个值得注意的取舍是移除卷积层以适配 Muon 优化器——虽然 Keller 原帖提到 Muon 可通过展平支持卷积,作者猜测团队可能实测后发现卷积+Muon 表现不佳才做此选择。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →