GDN-2 大幅超越 Mamba-2,3B 混合 MoE 版本待审批发布
teortaxesTex · x · 2026-09-26
NVIDIA 研究者 ahatamiz1 透露,其新线性注意力/序列建模架构 GDN-2 的更大规模变体已经训练完成,在对比实验中大幅超越 Mamba-2、GDP、KDA 等竞争方案。
- 近期的候选发布版本是 GDN-2-3B latent MoE:沿用 Nemotron-3 Nano 的整体架构,但把其中的 Mamba-2 层替换为 GDN-2
- 公开发布还需通过公司内部的多项审批,团队正在推进
- 若如期开源,这将是线性注意力路线在商用小模型上的又一次落地尝试
「研究」频道最新
- 函数梯度下降算法难题被攻克,论文入选 NeurIPS — CatAstro_Piyush · 2026-09-27
- 日语口语评测专用 ASR:莫拉标签错误率从 12.3% 降至 7.1% — tkasasagi · 2026-09-27
- kalomaze 提想:把 nanogpt 训练技巧搬到 DCT 系数上检验普适性 — kalomaze · 2026-09-27
- 本月长寿速览:AI 设计药物让 6 项衰老指标变年轻 — rand_longevity · 2026-09-27
- 猜想:单义表示完美后可免外部验证器训练编程 Agent — menhguin · 2026-09-27
- 9B 模型 80 次测试中 5 次把工具调用写成散文,评测揭示隐形失败 — Grimmoner · 2026-09-27