RTX 3090 单卡Qwen3.8-27B跑出124 TPS
iamMess · reddit · 2026-08-19
开发者展示了在 RTX 3090 上将 Qwen3.8-27B 推理速度提升至 124 TPS(贪婪采样)的极致优化成果。关键技术包括:
- 草稿词汇表优化:基于模型自身输出统计,覆盖率从 92% 提升至 97.5%,显著减少拒绝采样。
- 算子量化与定制:GPTQ-int4 量化 lmhead 和 MTP 模块,仅增加 0.6% PPL;编写 Split-KV attention 内核解决验证步骤的 SM 占用瓶颈(5-10倍加速)。
- 采样器补丁:无排序 top-k/top-p 和多块 softmax,提升默认采样性能。
- KVarN KV Cache:支持 26.2k 上下文(牺牲约 20% 长上下文解码速度)。
所有优化均保证生成分布一致,项目代码已开源。
所属事件:Qwen3.8-27B推理优化刷新RTX 3090单卡速度纪录(2 条相关)→
「Infra」频道最新
- NVIDIA 公布 Qwen3.8-2.4T 模型部署方案:GB300 显卡吞吐超 4000 tokens/s — PyTorch · 2026-08-21
- SpaceX 发射频率或助太空算力达 12-50GW — teortaxesTex · 2026-08-21
- 本地 AI 编码硬件分级:1000 美元起跑 27B 模型 — nickbaumann_ · 2026-08-21
- Cerebras 高管申报出售 1.53 亿美元股票,IPO 追高散户被重创 — firstadopter · 2026-08-21
- Fable 推出企业级安全护栏,支持本地基础设施部署 — trq212 · 2026-08-21
- IOTA SN9 测试异构 GPU 联网训练 16B 模型 — bittingthembits · 2026-08-21