Mirai 推理引擎 uzu 发布投机解码,M5 上超 llama.cpp 3 倍
TheMoonMidas · x · 2026-09-04
Mirai 在其本地推理引擎 uzu 中发布了投机解码(speculative decoding)实现,首发支持 Qwen3.6 27B,随后将支持 Qwen3.8 27B 与 Muse Glimmer。
- 在 Apple M5 系列芯片上,Qwen3.6 27B 4-bit(Mirai-M)输出速度达 105 tok/s,约为 MTPLX(MLX+投机解码,55 tok/s)的近 2 倍、llama.cpp(30 tok/s)的 3 倍以上。
- 按任务域看提升差异明显:HumanEval 编码 113.84 tok/s、MATH-500 117.30 tok/s,而通用聊天(MT-Bench)只有 84 tok/s——代码等易预测任务收益最大。
- 其 draft 模型、量化格式、验证算法与 GPU kernel 均为 Apple M5 的 GPU Neural Accelerators 从底层协同设计。
- 可通过 brew install mirai 直接运行,模型权重 14.5 GB,SDK 支持 Swift/TypeScript/Python/Rust。
所属事件:Uzu 推理引擎上线投机解码,M5 上速度超 llama.cpp 三倍(3 条相关)→
「Infra」频道最新
- NVIDIA Jetson 曝 initrd 命令注入漏洞,物理接触即可绕过 Secure Boot — jedisct1 · 2026-09-04
- Ollama 推出交互式菜单,本地模型与 Agent 启动不再靠记命令 — Technovangelist · 2026-09-04
- 高效推理团队推出 Nunchux,一个 API 聚合 30+ 图像视频模型 — junyanz89 · 2026-09-04
- Inco AI 公测:四大开源模型推理输出速度登顶 Artificial Analysis — Lianhuiq · 2026-09-04
- Starship 33 台猛禽同点火:7400 万牛顿推力两倍于土星五号 — PeterDiamandis · 2026-09-04
- xAI 孟菲斯获批第 5 座数据中心,耗资 4000 万美元换地 — chrisgrayson · 2026-09-04