Swift-Qwen3.8-27B 开源:思考长度砍 58.3%,速度近两倍且精度几乎无损

kisjovan · hn · 2026-09-16

团队对 Qwen 3.8 27B 做后训练,通过识别并惩罚与「过度思考」相关的 token(而非直接强行压缩推理长度),再用 On-Policy Distillation 补回精度,得到开源模型 Swift-Qwen3.8-27B:思考长度减少 58.3%,速度提升 1.95 倍,精度损失小于 1%。

关键主张:推理长度本身极其重要,不应硬砍,而应只优化其中无意义的部分——被定向处理的「过度思考」与类焦虑推理循环在 BF16 的该规模模型中也普遍存在,但对答案质量没有贡献。该方法是对 reasoning effort 设置、chat template、token 上限的补充而非替代。

模型发布 3 天即达 8 万下载,社区已有独立评测;提供 Nvidia 赞助 GPU 的免费研究用途 API(OpenAI 兼容,5RPM 限速),并放出 GGUF Q1-Q8 量化,社区还自制了 MLX、NVFP4、W4A16 等版本。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →