Mirai 推理引擎 Uzu 上线投机解码:Qwen 27B 在 M5 Max 跑出 105 tok/s

awnihannun · x · 2026-09-04

Mirai Labs 发布本地推理引擎 Uzu 的投机解码功能(首发支持 Qwen3.6-27B):在 Apple M5 Max 128GB 统一内存上实现 105 输出 tok/s 全端侧推理,比其测过的最快 MLX 投机解码实现快 2.9 倍。技术来自全栈协同设计:DFlash + 自研 Weaver 模型、树形投机解码、Mirai 量化、自研验证算法与针对 Apple Silicon 优化的 Metal kernels。官网还给出 uzu vs MLX vs llama.cpp 在同一台 M5 Max 上的公开跑分,统一用 1355 token 固定 prompt 测输出/输入速度与内存,投机解码速度取 MT-Bench、MATH-500、HumanEval 三数据集宏平均。作者称 token/s 并非最终关心的指标,后续还有更多内容。

所属事件:推理引擎 Uzu 发布投机解码,Qwen3.6 27B 提速明显(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →