Qwen3.8 模型 pMLX 引擎实测:12GB 显存跑代码
EyalToledano · x · 2026-09-01
Qwen3.8-Flash-Next 即将发布,基于 pMLX 引擎实现 tiered 模型与动态量化。该方案支持 bf16/q8/q4/q3 飞行量化、NVME 流式解码及专家剪枝。实测数据显示:Q3 量化下 12GB 内存最低配置可达 10 tok/s 持续解码;代码编辑任务中,Q4 32k 上下文配置可实现 58 tok/s 持续速度。
「Infra」频道最新
- 阿达尼:AI 竞争优势在于整合清洁能源与数据中心 — Div_pradeep · 2026-09-01
- Naver 提出 Verification-Aware Training:训练时模拟验证提升投机解码 — naver-ai · 2026-09-01
- ExLlamaV3 大更新:MoE 专家 CPU offload 与自校准量化 — Unstable_Llama · 2026-09-01
- Highlander 上线:自研 GPU 内核把实时视频成本砍半 — Small-Term672 · 2026-09-01
- GPU 债权人很保守:倾向短周期资产,残值常按零算 — AccBalanced · 2026-09-01
- SmolCluster:基于 Socket 的跨异构硬件分布式训练库 — retr0jirachi · 2026-09-01