逆向 Splash 包格式移植 Qwen3.8-27B,M5 Max 上 64k 上下文解码近 88 tok/s
SeveralViolins · reddit · 2026-09-22
- 开发者将 Swift-Qwen3.8-27B 4bit 量化模型移植到 Splash 推理引擎(仅限 macOS)。Splash 只文档化了包格式却没提供转换器,作者从引擎源码逆向推敲出字节级布局(分节偏移、打包顺序、量化规则),并用唯一的参考包验证;重活交给 Qwen 27B 完成,最后让 Opus 整理和抽查。
- 性能:在 M5 Max 128GB 上解码 79–129 tok/s;64k 上下文时 87.8 tok/s,而同样权重在 oMLX(oQ4e-mtp 混合 4/5-bit)只有 36.6 tok/s,且上下文越长差距越大。
- 踩坑:Splash 的 /v1 接口默认 greedy 解码,但 Swift 模型需要 temp 1.0 / topk 20 / topp 0.95,且包格式没有地方携带 generationconfig.,必须显式传参(用 DSH 的话写个 shim)。
- 许可:权重随上游项目,Swift Open License v1.0(营收低于 100 万美元可免费商用,该条件随权重传递)。
「Infra」频道最新
- Whittle 蒸馏模型走红 Reddit,27B-A3B 声称可在 8GB 显存笔记本跑 — depressedclassical · 2026-09-22
- Qdrant 实测:百万级向量搜索延迟抖动是后台优化器在干活 — qdrant_engine · 2026-09-22
- 免推理 SPLADE 检索:查询延迟降到 BM25 水平的做法 — qdrant_engine · 2026-09-22
- Cloudflare 全家桶的真实短板:D1 单线程、10GB 上限 — Paimaamu · 2026-09-22
- Rackspace 加入 NVIDIA 云伙伴计划,押注受监管行业全栈 AI 运维 — DavidLinthicum · 2026-09-22
- LuaJIT UDF 把 LLM 决策读出嵌进 DuckDB:零 token 概率分类进 SQL — Shoddy_Telephone9702 · 2026-09-22