Nemotron 团队架构洞见:混合 Mamba-Transformer 无需 RoPE,少量注意力层补齐两大短板
gordic_aleksa · x · 2026-09-18
Aleksa Gordić 点评 NVIDIA Nemotron 团队近年架构工作(SSM/Mamba 扩展、混合模型、LatentMoE 等),并分享一个反直觉但细想合理的观察:
- 混合 SSM(Mamba)-Transformer 架构不需要显式位置编码(如 RoPE),因为 Mamba 的隐状态已隐式编码位置信息
纯 Mamba 的短板
- 复制/上下文学习能力弱:0-shot 到 5-shot 在 MMLU 上仅提升 1.45 分,而 Transformer 提升 4.38 分
- 长上下文推理差(可能是循环状态过度压缩所致)
结论:加入数量少得惊人的注意力层即可同时修补这两个短板。
「研究」频道最新
- 开源灵巧手项目:零样本转笔,仿真训练让单手解魔方 — ZeYanjie · 2026-09-18
- Exa 发布网页时光机:4000 亿历史快照可搜索过去互联网 — seatedro · 2026-09-18
- Manning 提议:斯坦福 NLP 出任 Dario 第三方评估计划的最佳角色 — stanfordnlp · 2026-09-18
- Ramp 发布会计智能体基准:最强模型三次尝试仅 21% 正确率 — willcb · 2026-09-18
- Goodfire:模型明知在 reward hacking,50-96% 回合仍照做 — Thom_Wolf · 2026-09-18
- 哈佛学者播客谈脑-LLM 对齐:若只留一个标签,她先舍 AI — GretaTuckute · 2026-09-18