Mirai 推理引擎 Uzu 上线投机解码:Qwen 27B 在 M5 Max 跑出 105 tok/s
awnihannun · x · 2026-09-04
Mirai Labs 发布本地推理引擎 Uzu 的投机解码功能(首发支持 Qwen3.6-27B):在 Apple M5 Max 128GB 统一内存上实现 105 输出 tok/s 全端侧推理,比其测过的最快 MLX 投机解码实现快 2.9 倍。技术来自全栈协同设计:DFlash + 自研 Weaver 模型、树形投机解码、Mirai 量化、自研验证算法与针对 Apple Silicon 优化的 Metal kernels。官网还给出 uzu vs MLX vs llama.cpp 在同一台 M5 Max 上的公开跑分,统一用 1355 token 固定 prompt 测输出/输入速度与内存,投机解码速度取 MT-Bench、MATH-500、HumanEval 三数据集宏平均。作者称 token/s 并非最终关心的指标,后续还有更多内容。
所属事件:推理引擎 Uzu 发布投机解码,Qwen3.6 27B 提速明显(2 条相关)→
「Infra」频道最新
- Perplexity Portable Computer 登陆 Linux:RTX 24GB 显存起步 — cameronstow · 2026-09-04
- Tensordyne 发推理白皮书:台积电 3nm 芯片流片,宣称每兆瓦推理吞吐无敌 — kimmonismus · 2026-09-04
- 爱尔兰数据中心耗电占全国 23%,居民投诉神秘嗡鸣 — Graham_dePenros · 2026-09-04
- AI 算力卡在封装:亚利桑那晶圆仍要飞往东南亚封装 — ashwinl · 2026-09-04
- Qwen3.8-Flash-Next MTP 合入 ik_llama.cpp,5090 上速度翻倍至 90 tok/s — Alternative_Will5974 · 2026-09-04
- Erik Bernhardsson 自述:弃用 Kubernetes 从零造 Modal 的 AI 云 — charles_irl · 2026-09-04