Threadripper 3975WX 跑 Qwen 27B Q5 仅 10 tok/s,求助调优
ifjo · reddit · 2026-09-13
Reddit 用户在 r/LocalLLaMA 求助本地推理优化。
- 配置:Threadripper 3975WX(32 核)、256GB 内存、RTX 4070 Ti Super
- 现状:用 llama.cpp server 跑 unsloth 的 Qwen 27B Q5 量化版,仅约 10 tokens/s
- 只设置了 --ctx-size 和 --jinja,未做其他调优
- 询问:不换更强 GPU 的前提下,Qwen 这个量化等级是否已到瓶颈?
该机器原本主要用于虚拟化,内存充裕但 GPU 相对是短板,是典型的 CPU+单卡混合推理场景。
「Infra」频道最新
- 实测同模型换 harness 省 1/3 成本,Reddit 用户自建 LLM 自动路由 — leebase65 · 2026-09-13
- 博主拆解失控 agent 生存经济学:打不过超大规模推理的价格战 — voooooogel · 2026-09-13
- Databricks 把 Spark 调优旋钮几乎删光,老手担忧无处理解底层 — Zachly · 2026-09-13
- krishnan:2030 年医疗进步将来自可查询数据库,别 banning 数据中心 — krishnan · 2026-09-13
- A20 将内存移出热路径,苹果高管谈「thermal shadow」设计 — BenBajarin · 2026-09-13
- 社区将实验性 DeepSeek V4.1 steering 移植进 antirez 的 ds4 CLI — antirez · 2026-09-13