实测 Qwen3 8B/27B「少思考」量化版:思考 token 减 26-33%,ThinkingCap 总体提速 23%
DerTomsn · reddit · 2026-09-25
作者在单张 7900 XTX 上对比了两个主打「减少思考」的 Qwen 量化版(Swift 与 ThinkingCap)与常规量化版(unsloth Q4KM,4 个场景基准,各跑 2 次)。
核心数据:
- Token 节省是真的:总 token 数从 base 的约 6.6 万降到 ThinkingCap 约 4.9 万(-26%)、Swift 约 4.5 万(-33%)。
- 代价不同:ThinkingCap 的 prefill 极慢(约 100 t/s,TTFT 6-11 秒),decode 略降(43 t/s);Swift 则 prefill 最快(约 614 t/s,TTFT 约 1 秒)但 decode 大跌 33%(约 32 t/s)。
- 质量不掉:自评分数都在 84-87 区间,与 base 相同。
- 总耗时:ThinkingCap 比 base 快约 23%(1087s vs 1407s),token 节省足以抵消 prefill 慢;Swift 因 decode 拖累,总体基本打平(约 1400s)。
注意事项:每档只跑了 2 次,单次波动可能影响结论;ThinkingCap 异常慢的 prefill 原因待查。附有 llm-bench.io 的逐项对比链接。
「Infra」频道最新
- steipete 反驳成本论:能打的模型已降至 0.1 美元/百万 token — steipete · 2026-09-26
- e/acc 首领晒家庭推理集群:比跑车更潮的装备 — beffjezos · 2026-09-26
- 8B 模型跑在 2017 年老笔记本上:端侧智能时代悄然临近 — netherreddit · 2026-09-26
- 美国 AI 基建热超铁路公路电信之和,未来 6 年投资 10.3 万亿美元 — 141_1337 · 2026-09-26
- Oh My Pi 支持自定义模型后端:vLLM、llama.cpp、SGLang 接入 — bolts98 · 2026-09-26
- OpenRouter 推出缓存感知 Jev 路由器,为智能体请求自动选模型 — alexcovo_eth · 2026-09-26