Qwen 3.8 将推新引擎:支持动态量化与 NVMe 流式
MgkMshrmBrkfst · x · 2026-09-01
HamsterResearch 团队正在为 Qwen 3.8-Flash-Next 构建定制 MLX 引擎,主要特性包括:只需下载一次 bf16 分层模型,运行时可根据需求动态量化至 bf16/q8/q4/q3;支持从 NVMe 调整 n-gram 流式传输;可调整专家驻留内存比例。该引擎旨在实现 130-150 tok/s 的聚合解码速度,以支持子 Agent 的高效运行。
所属事件:Qwen3.8-Flash-Next 搭载 pMLX 引擎:小显存跑大模型(3 条相关)→
「Infra」频道最新
- 戴尔上调 2027 财收指引至 1920 亿,AI 服务器收入暴增 200% — Beth_Kindig · 2026-09-02
- 求购数据中心级光交换机(带图) — jwt0625 · 2026-09-02
- 求购数据中心级光交换机 — jwt0625 · 2026-09-02
- GB10 涨价引热议,Mac Studio 是否成为当前算力性价比之王 — geekender · 2026-09-02
- 循环深度技术可降低算力与带宽成本 — pstAsiatech · 2026-09-02
- Vercel 新增 AWS PrivateLink 支持,流量不经公网 — cramforce · 2026-09-02