ThinkingCap-Qwen3.6-27B 实测 35–45 tok/s 且质量未降

TinyFrodo · reddit · 2026-07-28

一位用户表示,自己在两天内把默认模型从 Qwen3.5-27B F16 换成了 ThinkingCap-Qwen3.6-27B F16。实测吞吐从原来的约 30–40 tok/s 提升到 35–45 tok/s,主观上没有感觉质量下降,推测是减少了 token 使用带来的收益。帖子还贴出了完整的 llama.cpp 启动命令,重点参数是 --spec-draft-n-max 4,并询问还能如何继续提升速度。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →