Reddit 疑问:同量化同配置,Qwen 3.8 为何比 3.6 更慢?

Specialist-2193 · reddit · 2026-08-19

用户在 Reddit 提问:在完全相同的量化(Q4KXL + MTP)、相同硬件(RTX 4090)、最新 llama.cpp、150k 上下文的条件下,Qwen 3.8 的吞吐却比 3.6 更慢,而两者架构相同、MTP 预测水平相近,按理 tps 应一致。用户疑惑除了 thinking 输出长度外还有什么原因导致变慢。属于本地推理性能排查的具体技术讨论。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →