开源 Swift-Qwen3.8-27B:思考 token 减 58%,速度翻倍精度几乎不掉
Secure_Recording_472 · reddit · 2026-09-14
UkisAI 对 Qwen 3.8 27B 做后训练优化, targeting「过度思考」问题:不直接砍推理长度,而是识别与 overthinking 循环相关的 token 并加以惩罚,再用 On-Policy Distillation 等手段恢复精度,最终实现思考 token 减少 58%、速度提升 1.95 倍、精度损失小于 1%,已开源发布。
他们的训练思路 TLDR:
- 从量化版 Qwen 3.8 27B 的随机推理循环入手,参考 Meta 针对 PTQ overthinking 的论文;
- 用 8xH100 生成跨编码/语言/视觉/agent 的大量分布外推理轨迹,聚类找出过度思考样本的「共性 token」;
- 构建推理时 token 惩罚器 + 自定义损失函数做 LoRA SFT,发现该方法不仅适用于低精度模型,对 BF16 同样有效;
- 尝试 RL(GSPO)、On-Policy Distillation 等恢复精度。
团队强调这不是 reasoning effort 设置的替代而是互补:推理长度本身很重要,不该被强行缩短,而应只优化其中无意义的部分。已提供 GGUF(Q1-Q8)及社区量化版本、Nvidia 赞助的免费研究用途 API(OpenAI 兼容,限 5 RPM)。
所属事件:开源 Swift-Qwen3.8-27B 登热榜,思考 token 减 58%(2 条相关)→
「模型」频道最新
- 从 Cursor 转投 Claude Code:第 3 天就用光了额度 — jdluk87 · 2026-09-15
- Claude Max 等订阅拉开算力鸿沟:AI 民主化承诺正被高价瓦解 — IndraVahan · 2026-09-15
- OpenAI CFO:Luna 模型降价 80%,用量激增 10 倍 — Beth_Kindig · 2026-09-15
- The Information:Palantir、Nvidia 因数据留存限制使用 Anthropic Fable — dotey · 2026-09-15
- GPU 穷人福音:K2 Horizon 7B 智能指数超 Qwen3.6 27B — Uncle___Marty · 2026-09-15
- 用户质疑 GPT-6 Astra 悄悄变笨,5 小时额度 5 分钟耗尽 — Vibe_Mint · 2026-09-15