MLX-Serve 发布 v26.95:Qwen-Image 2.1 上 Mac,四路并发提速近一倍
TheMoonMidas · x · 2026-09-23
- MLX-Serve v26.9.5(Bonsai)发布,并配套上线 iOS App,可在 Apple Silicon 上本地运行多种模型。
- 图像生成:支持 Qwen-Image-2.1 文生图/图生图与负向提示词,提供 8bit(32GB Mac)与 4bit(16GB Mac)两档量化包;小内存机器按需加载文本编码器并在去噪前释放。
- Prism Bonsai 2:Hadamard 旋转的 2-bit Qwen3.8-27B(文本+视觉),号称可能是最快实现,可像普通 Qwen 27B 一样加载服务。
- 并发性能:四个 MTP 流共享一次验证前向,M4 Max 上聚合速度从 72 提至 119 tok/s;修复长上下文下每步复制各流 KV 的问题(4 流 28k 上下文从 26 提至 64 tok/s);加载 DFlash drafter 后并发请求切到 MTP head,从 64 提至 122 tok/s。
- 8-bit KV 在长上下文下与 bf16 KV 速度相当。项目已在 GitHub 开源(1.5k star)。
「Infra」频道最新
- DeepSeek 弹性算力论文曝光:单套系统 160 节点日供 300 万沙箱 — zephyr_z9 · 2026-09-23
- llama.cpp 合并为 Gemma 26B A4B 优化 flash attention 形状 — jacek2023 · 2026-09-23
- 开源本地 AI 应用层 SAFi:接 llama.cpp 即可给企业交付私有部署 — forevergeeks · 2026-09-23
- Claude Opus 5.5 登陆 AWS Bedrock:更省 token、降价并首次带安全分类器 — AWS ML Blog · 2026-09-23
- Ben Bajarin 推出付费专家访谈:从天然气到吉瓦级 AI 供电 — BenBajarin · 2026-09-23
- umbrelOS 2.0 发布:把家里的小电脑变成你的私有云 — JosephJacks_ · 2026-09-23