单卡4090跑Qwen 27B:KV缓存量化后上下文冲上35万
UDPSendToFailed · reddit · 2026-08-17
开发者 UDPSendToFailed 更新了其 fork 的推理引擎 NInfer,为 KV 缓存新增 rk2v4-e8 量化选项,可在单张 RTX 4090 上运行 Qwen 27B 模型时把上下文窗口做到 25 万-35 万 token,全程不溢出到系统内存;是否启用视觉、MTP 等配置会影响实际上限。
在较低上下文设置下他还做了生成速度优化,代码、数学等重复性任务可达约 80-160 token/s。项目已开源在 GitHub(UDPSendToFailed/ninfer-4090),作者欢迎反馈运行时问题。
「Infra」频道最新
- LifeOS:基于本地模型的语音驱动个人管理工具 — Extension-Bid-639 · 2026-08-24
- 超算中心硬件选型:SSD与HDD的密度权衡 — generativist · 2026-08-24
- 三星展示 HBM 散热新方案,芯片性能存差异 — BenBajarin · 2026-08-24
- Tobi 开源 walgit:无数据库的单二进制 Git 服务器 — jevon · 2026-08-24
- s3collections:用S3构建分布式系统持久化数据结构 — andersonbcdefg · 2026-08-24
- 预测市场:年底前美一州实施数据中心禁令概率 68% — Polymarket · 2026-08-24