Swift 1.5 + HyperQwen:RTX 3090 上任务耗时降 37%、跑出 100+ tok/s

KingGongzilla · reddit · 2026-09-29

作者将 UkisAI 的 Swift/Swift 1.5 微调(基于 Qwen3.8 27B、输出 token 更少)适配到 HyperQwen 推理栈,在单张 RTX 3090 24GB、FP8 KV cache、150k 上下文下,对约 630 个任务做了基准。

性能:Swift 1.5 fast 平均任务耗时 68.2s,比 HyperQwen 原版 fast 量化(108.1s)快约 37%,输出 token 从 8,985 降到 5,669,解码速度仍达 107 tok/s。

质量几乎无损:GSM8K 97.5%、LiveCodeBench 91%、自建工具调用 JSON 评测 30/30,困惑度略升(6.551→6.679)。

做法:保留 AWQ INT4 权重、embedding 转 INT8;INT8 版量化输出头与 MTP(多 token 预测)层并加入参考 draft 词表做投机解码;fast 版改用 GPTQ INT4 并构建 65,536 token 的专用 draft 词表。无需额外微调。

三个模型权重与 RUNTIME.md 部署指引都已开在 Hugging Face。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →