Reddit 疑问:同量化同配置,Qwen 3.8 为何比 3.6 更慢?
Specialist-2193 · reddit · 2026-08-19
用户在 Reddit 提问:在完全相同的量化(Q4KXL + MTP)、相同硬件(RTX 4090)、最新 llama.cpp、150k 上下文的条件下,Qwen 3.8 的吞吐却比 3.6 更慢,而两者架构相同、MTP 预测水平相近,按理 tps 应一致。用户疑惑除了 thinking 输出长度外还有什么原因导致变慢。属于本地推理性能排查的具体技术讨论。
「Infra」频道最新
- Pydantic Logfire:为生产 AI 引入类型化特性开关 — samuelcolvin · 2026-08-19
- Claude 推出 Tool Search 优化 Agent 多工具调用 — WirelessLife · 2026-08-19
- Baseten 称其为 DeepSeek V4 Pro 最快推理提供商 — baseten · 2026-08-19
- 黄仁勋急推 500 亿 SPV 基金?传 NVDA 削减俄州数据中心投资 — GaryMarcus · 2026-08-19
- 从 RTX 5080 升级:多 GPU 混合配置方案成本分析 — the_macks · 2026-08-19
- RunInfra 推 DeepSeek V4 Pro: 百万上下文、极速推理 — alejandroll10 · 2026-08-19