Qwen3.8-Flash 支持 75GB 内存本地运行并推量化版
Unsloth 宣布 125B 参数的多模态 MoE 模型 Qwen3.8-Flash 支持 75GB 内存本地运行,该模型基于 Qwen4 架构预览,性能号称超越 Claude-4.6-Opus。随后 Unsloth AI 又发布了 Qwen3.8-Flash-Next 的 GGUF 量化版本,涵盖 1bit 到 4bit 精度,并建议用户使用 llama.cpp 进行推理部署,进一步降低本地部署门槛。
2026-08-26 ~ 2026-08-27 · 2 条相关
- 第 1 集:阿里官宣 Qwen3.8-Flash-Next,Qwen4 架构预览 8 月 26 日开源(2026-08-25,13 条)
- 第 2 集:阿里开源Qwen3.8-Flash-Next:125B稀疏MoE预览Qwen4架构(2026-08-26,16 条)
- 第 3 集:Qwen3.8-Flash 支持 75GB 内存本地运行并推量化版(2026-08-26,2 条)
- Qwen3.8-Flash 支持本地运行,125B 模型仅用 75GB 内存 — danielhanchen · 2026-08-26
- Qwen3.8-Flash-Next 发布 1-4bit GGUF 量化版 — MaziyarPanahi · 2026-08-27