Qwen3.8-27B 跑满 RTX 5090:NVFP4 量化实现 256 t/s 代码生成,支持 17.5 万上下文
pennyonaire · reddit · 2026-08-30
分享了在单块 RTX 5090 上运行 Qwen3.8-27B 的完整方案。该方案采用 Blackwell 架构特调配方,使用 NVFP4 量化(相当于 Q6)、sglang 引擎及 DFLASH2 推测解码。实测数据显示,代码生成速度可达 256 t/s(单槽)和 451 t/s(双槽并行),散文生成达 144 t/s。该配置支持 175k 上下文池,利用 Host-RAM KV 层技术,约 10 万 token 的对话恢复时间仅需约 1 秒。此外,方案通过量化 lmhead 和优化 KV 缓存节省显存,并给出了具体的调优参数(如 Spec tokens 大小)和性能评测数据(GPQA 84.8%)。作者还提供了一个请求代理小技巧,通过令牌计数管理请求队列,防止大请求阻塞并行槽位。
「Infra」频道最新
- SpaceX 自建涡轮铸造厂,为 AI 算力解决供电瓶颈 — rohanpaul_ai · 2026-08-30
- llama.cpp 启用 NUMA 镜像,双路 EPYC 推理性能暴增 137% — mattescala · 2026-08-30
- 推个人 AI 数据中心 Autonomous,2.6 万美元起售 — dee_hw · 2026-08-30
- 双 A100 显卡当前最佳的 LLM 推理方案是哪个? — Theio666 · 2026-08-30
- 分析称 Meta 算力资产被低估,对外销售潜力巨大 — RihardJarc · 2026-08-30
- FlashAccel:利用高带宽闪存加速 LLM 推理 — 9r4n4y · 2026-08-30