单卡 4090 跑 Qwen 27B/Gemma 31B 本地推理,如何平衡量化与上下文

MooseEfficient2151 · reddit · 2026-09-08

Reddit 用户分享本地推理配置:RTX 4090(24GB)+ 64GB DDR5 + Ryzen 7950x,想把代码索引和内部文档处理从外部 API 迁到本地以保护隐私。实测发现 Qwen 3.6 27B 以 Q4 量化放 VRAM 运行流畅,但更大的稠密模型或 gpt-oss 20b 做上下文 offload 后生成速度骤降。发帖人向社区请教 vLLM/llama.cpp 的后端与量化组合,如何在单卡上兼顾上下文长度和 tok/s。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →