实测 Muse Glimmer 30B 扩展至 1M 上下文:检索全通过
StartupTim · reddit · 2026-08-11
一位开发者在双机 NVIDIA DGX Spark 集群上,成功将 Meta 发布仅一天的 Muse Glimmer 30B 模型上下文从训练时的 131K 扩展至 1M,并在各长度下通过了 3/3 的“大海捞针”测试。
- 硬件与推理:使用 llama.cpp 并开启 DFlash 投机解码,单机解码速度达 36-38 tok/s(约 3 倍提升)。跨双机 RPC 拆分虽可行但受网络延迟影响,反而比单机慢 30%。
- 长上下文原理:作者分析其完美扩展的原因在于 Muse 架构特殊——13 层全局注意力层完全无位置编码,而 39 层滑动窗口层虽有 RoPE 但仅限 2K 窗口,因此 YaRN 拉伸对长距离检索几乎无破坏。
- 资源占用:权重、推测解码器、视觉模块及 1M KV 缓存总共占用约 60GB 显存。
作者认为这是一个极强的本地智能体模型,期待后续 vLLM 支持 RDMA 多卡部署。
「Infra」频道最新
- MacBook 联手 DGX Spark:实测异构分离推理与 KV Cache 传输 — HankYeomans · 2026-08-11
- RTX 3060 实测:显存分配如何改变 LLM 推理执行策略 — Abhishekcur · 2026-08-11
- 长鑫 17nm DDR5 良率超 90%,美系大厂限制采购 — teortaxesTex · 2026-08-11
- 专家:开源模型推理成本降 8 倍,算力基建成新瓶颈 — latticecut · 2026-08-11
- llama.cpp 新增 ROCm 7.14 CI 支持,提升 AMD 显卡推理 — pmttyji · 2026-08-11
- 深冷蒸馏:芯片供应链中隐秘的气体分离咽喉 — anderssandberg · 2026-08-11