开源 Swift-Qwen3.8-27B:思考 token 减 58%,速度翻倍精度几乎不掉

Secure_Recording_472 · reddit · 2026-09-14

UkisAI 对 Qwen 3.8 27B 做后训练优化, targeting「过度思考」问题:不直接砍推理长度,而是识别与 overthinking 循环相关的 token 并加以惩罚,再用 On-Policy Distillation 等手段恢复精度,最终实现思考 token 减少 58%、速度提升 1.95 倍、精度损失小于 1%,已开源发布。

他们的训练思路 TLDR:

团队强调这不是 reasoning effort 设置的替代而是互补:推理长度本身很重要,不该被强行缩短,而应只优化其中无意义的部分。已提供 GGUF(Q1-Q8)及社区量化版本、Nvidia 赞助的免费研究用途 API(OpenAI 兼容,限 5 RPM)。

所属事件:开源 Swift-Qwen3.8-27B 登热榜,思考 token 减 58%(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →