实测 Qwen3 8B/27B「少思考」量化版:思考 token 减 26-33%,ThinkingCap 总体提速 23%

DerTomsn · reddit · 2026-09-25

作者在单张 7900 XTX 上对比了两个主打「减少思考」的 Qwen 量化版(Swift 与 ThinkingCap)与常规量化版(unsloth Q4KM,4 个场景基准,各跑 2 次)。

核心数据:

注意事项:每档只跑了 2 次,单次波动可能影响结论;ThinkingCap 异常慢的 prefill 原因待查。附有 llm-bench.io 的逐项对比链接。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →