RTX 5080 16GB 跑 Qwen 27B 真 Q4:61K 上下文 13 tok/s 调优实录
nofuture09 · reddit · 2026-09-02
Reddit 用户分享在 RTX 5080 16GB 上本地运行 Qwen3.8-27B 的完整调优过程,目标是保住真 Q4KM 量化的同时实现深上下文可用:
- 硬件与配置:RTX 5080 16GB + i5-14600K + 64GB DDR5,Unsloth UD-Q4KM 量化(16.46GB),官方 llama.cpp b10760 CUDA 构建,65,536 上下文,Q40 KV cache + Flash Attention,Pi 作为编码 agent。
- 关键技巧——选择性 FFN offload:把 16 个最大的 FFN 张量组(约 2.764 GiB)移到 CPU,attention/KV 与其余张量留 GPU;相比 LM Studio 的整层 offload(约 6.6 tok/s),达到稳定 13.2 tok/s@50-61K 上下文,4/4 检索全部命中。
- 意外发现:MTP 投机解码在此场景反而拖慢速度(MTP1 8.65、MTP3 7.81 tok/s),作者推测是 CPU draft 与溢出到内存的 FFN 争抢内存带宽。
- 补充说明:近期热传的 5080 上 75 tok/s 结果用的是 IQ3S FFN 的自定义量化,属速度换精度;作者坚持真 Q4 并公开了完整启动脚本、张量 override、Pi 配置、基准脚本与失败方案(GitHub 仓库)。
- 局限:检索测试为合成 prompt,编码任务是冒烟测试而非 SWE-bench,结果对内存带宽与 llama.cpp 版本敏感。
「编程与Agent」频道最新
- Polar Analytics 推出 Slack 内 AI 运营员,实时审计广告与库存数据 — JaynitMakwana · 2026-09-02
- “4 万美元吉他买不来 Mike Rutherford”:编程功底决定 AI 编码上限 — JFPuget · 2026-09-02
- 两周跑出 8 个 SEO 草稿 PR,单次成本不到 1 美元 — Pitiful-Surround-285 · 2026-09-02
- 与其找现成产品,不如 vibe code 一个专为自己定制的工具 — Philmod · 2026-09-02
- NPO 论文:提示词优化或不需要搜索树,教师模型质量更关键 — rohanpaul_ai · 2026-09-02
- Podium 弃用自研 agent 运行时,全面迁移至 LangSmith deployments — LangChain · 2026-09-02