Meta Muse Glimmer 30B 惊人架构:原生支持 512k 上下文
mr_il · reddit · 2026-08-17
作者通过修改配置将 Muse Glimmer 30B 的上下文从 128k 扩展至 512k,无需 LoRA 等常规手段,并在多项基准测试中取得优异成绩。
架构发现:
- 该模型架构独特,全 GQA 注意力层无位置编码,仅 2048 宽度的 SWA 层带 RoPE。
- 这种设计依赖 SWA 层与上下文推断长距离关系,使其极易于扩展上下文。
实测结果 (512k tokens):
- Needle in a Haystack (1/4 needles): 100%
- Multi-hop retrieval: 100%
- Semantic lookups: 100%
- Memory (Agentic session): 100% (至 385k)
- LongBench v2: 性能无衰减
- LongCodeQA: 性能无衰减
- Counting instances: 在超长序列下性能有所下降 (385k 时 60%,512k 时 22%)。
代码与报告已开源。
「模型」频道最新
- Meta 发布 Muse Code,阿里开源 Qwen3.8-27B — emmanuelvivier · 2026-08-17
- Meta 开源 300 亿参数智能体模型 Muse Glimmer,消费级 GPU 即可运行 — emmanuelvivier · 2026-08-17
- 网友吐槽 Qwen 3.8 27B 默认“想太多” — emax · 2026-08-17
- 被 Claude 编码能力忽悠? 代码多是复制粘贴 — art_zucker · 2026-08-17
- 实测Fable代码能力:胜过Opus 5的优雅解法 — arjunrajlab · 2026-08-17
- DeepSeek 周日涨价:V4-Flash 高峰输出价暴涨近 5 倍 — NeuralNomad87 · 2026-08-17