P40 上跑 Qwen 3.6 35B IQ4 量化,实测 37-83 tok/s 并不更慢

otacon6531 · reddit · 2026-09-29

Reddit 本地部署用户分享:在 NVIDIA P40 上用 llama.cpp 跑 Qwen 3.6:35b 的 IQ4 量化,MTP 开启时速度在 37-83 tok/s 之间,prefill 从约 600 起随长 prompt 降至 300-400。AI 提示 IQ 量化在 P40 上明显更慢并引用两年前的旧帖,但作者从 Q4 换到 IQ4 并未感到变慢,发帖质疑该说法是否已过时。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →