单卡4090跑Qwen 27B:KV缓存量化后上下文冲上35万

UDPSendToFailed · reddit · 2026-08-17

开发者 UDPSendToFailed 更新了其 fork 的推理引擎 NInfer,为 KV 缓存新增 rk2v4-e8 量化选项,可在单张 RTX 4090 上运行 Qwen 27B 模型时把上下文窗口做到 25 万-35 万 token,全程不溢出到系统内存;是否启用视觉、MTP 等配置会影响实际上限。

在较低上下文设置下他还做了生成速度优化,代码、数学等重复性任务可达约 80-160 token/s。项目已开源在 GitHub(UDPSendToFailed/ninfer-4090),作者欢迎反馈运行时问题。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →