Swift 1.5 + HyperQwen:RTX 3090 上任务耗时降 37%、跑出 100+ tok/s
KingGongzilla · reddit · 2026-09-29
作者将 UkisAI 的 Swift/Swift 1.5 微调(基于 Qwen3.8 27B、输出 token 更少)适配到 HyperQwen 推理栈,在单张 RTX 3090 24GB、FP8 KV cache、150k 上下文下,对约 630 个任务做了基准。
性能:Swift 1.5 fast 平均任务耗时 68.2s,比 HyperQwen 原版 fast 量化(108.1s)快约 37%,输出 token 从 8,985 降到 5,669,解码速度仍达 107 tok/s。
质量几乎无损:GSM8K 97.5%、LiveCodeBench 91%、自建工具调用 JSON 评测 30/30,困惑度略升(6.551→6.679)。
做法:保留 AWQ INT4 权重、embedding 转 INT8;INT8 版量化输出头与 MTP(多 token 预测)层并加入参考 draft 词表做投机解码;fast 版改用 GPTQ INT4 并构建 65,536 token 的专用 draft 词表。无需额外微调。
三个模型权重与 RUNTIME.md 部署指引都已开在 Hugging Face。
「Infra」频道最新
- Grass 创始人撰文:训练数据仍是 AI 实验室的第一刚需 — toptickcrypto · 2026-09-29
- Modal Labs 接近完成 7.5 亿美元融资,估值 157.5 亿 — TechCrunch AI · 2026-09-29
- exe.dev 取消按席位计费:企业改按算力池付费,个人版降至 $15/月 — davidcrawshaw · 2026-09-29
- exo 个人版降价至 $15/月:2 vCPU/4GB,不再送 tokens 改绑 ChatGPT 订阅 — davidcrawshaw · 2026-09-29
- 全本地训练 0.8B/2B 决策模型,2B 得分 83.1% 追平 Jev — Usual_Maximum7673 · 2026-09-29
- 单卡 DGX Spark 跑 Qwen3.8 Flash 212 tok/s,作者开源完整 vLLM 配方 — DimeRhyme · 2026-09-29