P40 上跑 Qwen 3.6 35B IQ4 量化,实测 37-83 tok/s 并不更慢
otacon6531 · reddit · 2026-09-29
Reddit 本地部署用户分享:在 NVIDIA P40 上用 llama.cpp 跑 Qwen 3.6:35b 的 IQ4 量化,MTP 开启时速度在 37-83 tok/s 之间,prefill 从约 600 起随长 prompt 降至 300-400。AI 提示 IQ 量化在 P40 上明显更慢并引用两年前的旧帖,但作者从 Q4 换到 IQ4 并未感到变慢,发帖质疑该说法是否已过时。
「Infra」频道最新
- 单卡 DGX Spark 跑 Qwen3.8 Flash 212 tok/s,作者开源完整 vLLM 配方 — DimeRhyme · 2026-09-29
- Reddit 热议:千元级本地跑 SOTA 模型的设备是下一个大机会 — Robert__Sinclair · 2026-09-29
- SemiAnalysis:6000 个数据中心项目仅 3 个受暂停令影响 — MatthewBerman · 2026-09-29
- Cloudflare 生日周开源大礼包:forge、vinext 1.0、Rust Workers 等 8 项更新 — ritakozlov · 2026-09-29
- 谷歌趋势美国区榜首全是怀俄明州?作者疑因数据中心机器流量 — lilyraynyc · 2026-09-29
- Sentdex:本地跑了 40 亿 token,GLM 5.3 Flash 成其最常用本地模型 — Sentdex · 2026-09-29