RTX 3090 跑 Qwen3.8-27B 推理达 134 TPS,长文响应秒回
iamMess · reddit · 2026-08-20
作者将 Qwen3.8-27B 在 RTX 3090 上的推理速度推至 134 TPS(默认采样),并大幅降低长对话多轮响应延迟(从 23 秒降至约 1 秒)。
核心优化:
- DFlash2 草稿模型:引入 5 层块草稿模型,一次预测 7 个 token。作者将其量化为 Int4,体积缩至 1.19GB,性能提升显著。
- Lookup-augmented 草稿:利用 Triton 核扫描历史 Token,直接复现长文本中的引用或重复代码,在特定任务上提升 29% tokens/step。
- 前缀缓存:针对 Mamba/GDN 混合模型开启缓存,使 24k 文档的第二轮对话延迟从 23 秒降至 1 秒左右。
- 显存优化:修复分配器逻辑,将 64k 上下文的单 Token KV 占用从 105KB 降至 78KB。
性能数据:
- 单用户:134 TPS(默认采样)。
- 64 并发:942 TPS。
- 质量:Perplexity 8.09,GSM8K 96.5%,无明显损耗。
所属事件:RTX 3090 上 Qwen3.8-27B 推理提速至 381 TPS(2 条相关)→
「Infra」频道最新
- 测算显示航空电力成本仅$40,燃油时代将终结 — examachine · 2026-08-21
- 瑞士两千人小镇拟建 400 兆瓦数据中心 — ZeroStateReflex · 2026-08-21
- 深度驳斥:数据中心用水量被媒体严重误导 — AndyMasley · 2026-08-21
- OpenAI 招聘「降低数据中心反对风险」岗位,被指意在化解社区阻力 — dinabass · 2026-08-21
- Ornith 1.5 35B Q5 本地跑进 GitHub Copilot,Mac M3 Max 可用 — DanWahlin · 2026-08-21
- AI经济计算云兴起:训练、推理与路由成焦点 — rhythmrg · 2026-08-21