Qwen3.8-27B 原生 8 位在 M5 Pro 跑出 37-55 tok/s,破解 4 位量化推理断崖

SnooPredictions515 · reddit · 2026-09-21

作者在 Apple Silicon(M5 Pro,64GB 统一内存)上对 Splash 引擎(Incoai 出品的 C++/Metal 投机解码引擎)做了扩展,实现 Qwen3.8-27B 的原生 8 位推理,综合 37-55 tok/s,无量化精度损失。

关键发现:

资源: 模型权重、Q8 Metal 运行时 fork 和完整 benchmark JSON 日志均已开源发布(Hugging Face / GitHub)。上游 Splash 1.0 只认 4 位 schema,该 fork 新增 schema 5 加载与编译型 Metal Q8 tiled 解码 kernel,并保持对官方 Q4 模型 100% 向后兼容。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →