Qwen3.8-Flash-Next 架构解析:预计本地内存约 82GB
pmv143 · reddit · 2026-08-26
Reddit 用户分析了尚未发布的 Qwen3.8-Flash-Next 架构(约 125B-A6B + 51B n-gram)。其 4-bit 量化理想状态下需 82GB 显存(58GB 主权重 + 24GB n-gram 表)。由于 n-gram 表是稀疏访问,非常适合卸载到系统内存,这可能使其在权重发布后对本地部署非常友好。
「Infra」频道最新
- vLLM 实现 1T 参数模型分片传输,耗时仅 7.53 秒 — TheZachMueller · 2026-08-26
- 分析师:OpenAI 与 Anthropic 验证自研芯片必要性 — BenBajarin · 2026-08-26
- 跑提示词其实不需要买 Mac Studio — rudrank · 2026-08-26
- 分析师解读 OpenAI Jalapeno:混合云或为长期战略 — BenBajarin · 2026-08-26
- Arduino 推出 VENTUNO Q:40 TOPS NPU 本地跑 LLM — ryanshrout · 2026-08-26
- OpenAI 推广 Jalapeño 支持开源模型,或仿谷歌售硬件 — BenBajarin · 2026-08-26