RTX 4090 跑 Qwen3 27B 达 90 t/s,附完整 llama.cpp 配置
SirApprehensive7573 · reddit · 2026-08-21
用户分享在 RTX 4090(24GB 显存全空闲)上用 llama.cpp 跑 Qwen3-27B UD-IQ4XS 量化版的具体配置:全 GPU 层、FlashAttention、KV cache 用 q80、batch 256/ubatch 64,并用 MTP-2 投机解码,在 242k 上下文下达到约 90 t/s。不启用 MTP 时可跑满 262k 上下文但速度降到 45-50 t/s;作者在大型代码库上配合 opencode 使用,更看重速度而非多出的 20k 上下文。他还对比了其他 Q4 量化与 FP16 KV cache,均未察觉差别。
「Infra」频道最新
- LifeOS:基于本地模型的语音驱动个人管理工具 — Extension-Bid-639 · 2026-08-24
- 超算中心硬件选型:SSD与HDD的密度权衡 — generativist · 2026-08-24
- 三星展示 HBM 散热新方案,芯片性能存差异 — BenBajarin · 2026-08-24
- Tobi 开源 walgit:无数据库的单二进制 Git 服务器 — jevon · 2026-08-24
- s3collections:用S3构建分布式系统持久化数据结构 — andersonbcdefg · 2026-08-24
- 预测市场:年底前美一州实施数据中心禁令概率 68% — Polymarket · 2026-08-24