Qwen3.8-27B 原生 8 位在 M5 Pro 跑出 37-55 tok/s,破解 4 位量化推理断崖
SnooPredictions515 · reddit · 2026-09-21
作者在 Apple Silicon(M5 Pro,64GB 统一内存)上对 Splash 引擎(Incoai 出品的 C++/Metal 投机解码引擎)做了扩展,实现 Qwen3.8-27B 的原生 8 位推理,综合 37-55 tok/s,无量化精度损失。
关键发现:
- 推理断崖(Reasoning Cliff): 上游 Splash 主打 4 位模型的高速度(约 60 tok/s),但激进 4 位量化在竞赛级数学和多步推导上出现明显能力下降。
- 性能对比: 原生 8 位(Splash-HQ,27GB)在五个标准任务域平均 36.9 tok/s,是 MLX/llama.cpp 自回归基线(9.9 tok/s)的 3.73 倍;数学推理达 54.8 tok/s。对比同样 8 位权重的 MTPLX 快约 39%(数学快 92%),归功于编译型 Metal 后端更低的调度开销。
- 精度-速度悖论: 原生 8 位平均反而比压缩 8 位(Splash-Q8,17GB)略快(36.9 vs 36.5 tok/s)——激进压缩压平了 logits、降低草稿接受率;原生 8 位 logits 更尖锐,验证回滚更少,净吞吐更高。
- 支持 256k 上下文扩展,实测遥测到 190k。
资源: 模型权重、Q8 Metal 运行时 fork 和完整 benchmark JSON 日志均已开源发布(Hugging Face / GitHub)。上游 Splash 1.0 只认 4 位 schema,该 fork 新增 schema 5 加载与编译型 Metal Q8 tiled 解码 kernel,并保持对官方 Q4 模型 100% 向后兼容。
「Infra」频道最新
- Levelsio 揭秘:单台 VPS 曾扛 3 亿年访问量 — PratikKadam_ · 2026-09-21
- Qdrant 实测检索候选深度:扩到 500 只提升上限 0.28,实际分数几乎不动 — qdrant_engine · 2026-09-21
- gemini-cli 修复会话退出挂起:stdin、MCP 子进程清理全链路补丁 — Pcmhacker-piro · 2026-09-21
- lemire 实测:CPU 每个周期到底能处理多少条分支指令 — lemire · 2026-09-21
- 谷歌提出 Orphaned VMs:主机内核停机更新时虚拟机照常运行 — jedisct1 · 2026-09-21
- 一条 gcloud 命令上云跑 DiffusionGemma,RTX 6000 Blackwell 约 $3/小时 — bodonoghue85 · 2026-09-21