Qwen3.8 180B 级模型仅需 39GB 显存即可运行
EyalToledano · x · 2026-08-28
来自 HamsterResearch 实验室的 Qwen3.8-Flash-Next-REAP-288-MLX-4bit 模型,这是一个 180B 级别的模型,仅需 39GB 内存即可运行。
- 采用 MLX 原生 4 位,比原版 q4 小 60%。
- 通过 REAP 算法将专家数从 512 剪枝至 288。
- HumanEval 分数为 91.5%(原版为 93.9%)。
所属事件:剪枝+量化让 180B 模型仅用 39GB 显存运行(2 条相关)→
「Infra」频道最新
- 传闻 Anthropic 拟自研训练芯片,深入算力基建 — zephyr_z9 · 2026-08-28
- 印度砸 134 亿美元推「半导体 2.0」,力攻芯片设计与制造 — SumitGup · 2026-08-28
- Meta/Google 将探讨 AI 数据中心光互连架构与能效 — jwt0625 · 2026-08-28
- Coherent-lite 在可插拔光模块能效追平 IMDD — jwt0625 · 2026-08-28
- 纯 MLX 引擎推理提速至 65 tok/s,显存需求减半 — EyalToledano · 2026-08-28
- Qwen3.8 变体实测:8 位量化显存占用降 27% — EyalToledano · 2026-08-28