Qwen 3.8 将推新引擎:支持动态量化与 NVMe 流式

MgkMshrmBrkfst · x · 2026-09-01

HamsterResearch 团队正在为 Qwen 3.8-Flash-Next 构建定制 MLX 引擎,主要特性包括:只需下载一次 bf16 分层模型,运行时可根据需求动态量化至 bf16/q8/q4/q3;支持从 NVMe 调整 n-gram 流式传输;可调整专家驻留内存比例。该引擎旨在实现 130-150 tok/s 的聚合解码速度,以支持子 Agent 的高效运行。

所属事件:Qwen3.8-Flash-Next 搭载 pMLX 引擎:小显存跑大模型(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →