一人搞定 Qwen 3.8 Mac 全栈优化:高上下文解码提速 54%
julianharris · x · 2026-08-29
独立研究者 Youssof 发布 MTPLX V2.10,对 Qwen 3.8 在 Mac 上做了一整套全栈性能优化,被 Julian Harris 称为「一人的本地 AI 研究 powerhouse」——不是零碎调参,而是从模型底层 kernel 优化到自研推理 serving 的系统性工程。亮点:
- 新增 Qwen 3.8 Next 支持:4 bit/8 bit 优化版模型在高上下文下持续跑出 50–80 TPS
- mmap 流式加载:32 GB n-gram 表从 SSD 经 mmap 流式读取而非占内存,两个模型可同时塞进 96 GB Mac 且零速度损失
- 27B 版解码全面提速:3k 上下文 +15% TPS,88k +29%,147k +54%,prefill +41%
- 48 GB Mac 逆袭:30k 上下文下从 swap 里的 3–4 TPS 提升到 33 TPS
- KV Cache 问题解决:8 bit 和 4 bit 缓存几乎不再拖慢速度(此前会下降 50%)
Julian Harris 建议 Jeremy Howard 的 Answer.ai 赶在他被大厂收编之前把人挖走。
「Infra」频道最新
- Apodex 推前沿计划,每月提供 10 万美元算力信贷 — Scobleizer · 2026-08-29
- Exo Labs 宣称 Mac Studio 集群内存带宽可达 4.8TB/s 且线性扩展 — anonmt57 · 2026-08-29
- Lightning AI 上线 H200 算力,虚拟机进入公测 — LightningAI · 2026-08-29
- 开源个人 AI 数据中心:从桌边到机架的全套指南 — dee_hw · 2026-08-29
- 英伟达的 AI 优势正超越 GPU:数据中心靠智能流量调度提效 — TechCrunch AI · 2026-08-29
- 对比数据:一个汉堡的水耗抵 800 万次 ChatGPT 查询 — dc_lawrence · 2026-08-29