ThinkingCap-Qwen3.6-27B 实测 35–45 tok/s 且质量未降
TinyFrodo · reddit · 2026-07-28
一位用户表示,自己在两天内把默认模型从 Qwen3.5-27B F16 换成了 ThinkingCap-Qwen3.6-27B F16。实测吞吐从原来的约 30–40 tok/s 提升到 35–45 tok/s,主观上没有感觉质量下降,推测是减少了 token 使用带来的收益。帖子还贴出了完整的 llama.cpp 启动命令,重点参数是 --spec-draft-n-max 4,并询问还能如何继续提升速度。
「Infra」频道最新
- Kimi K3 现阶段只适合 API 多节点部署,本地对齐还要数月到数年 — johnseach · 2026-07-28
- 63 家 API 公司里只有一家同时具备三类 agent 接口 — ExtensionPea834 · 2026-07-28
- Reddit 质疑:1.367 亿笔 x402 交易真能证明 agent 采用吗 — heiba_wk · 2026-07-28
- 梗图调侃:本地模型会挤掉中间商并压低硬件需求 — HugoCortell · 2026-07-28
- 图数据库云端 16GB 要价 2.5 万美元,他改做 Apple Silicon 版 — arthurcolle · 2026-07-28
- Moonshot 的 Kimi K3 上线 Nebius,兼容 OpenAI API 且支持 1M 上下文 — rohanpaul_ai · 2026-07-28