Swift-Qwen3.8-27B 开源:思考长度砍 58.3%,速度近两倍且精度几乎无损
kisjovan · hn · 2026-09-16
团队对 Qwen 3.8 27B 做后训练,通过识别并惩罚与「过度思考」相关的 token(而非直接强行压缩推理长度),再用 On-Policy Distillation 补回精度,得到开源模型 Swift-Qwen3.8-27B:思考长度减少 58.3%,速度提升 1.95 倍,精度损失小于 1%。
关键主张:推理长度本身极其重要,不应硬砍,而应只优化其中无意义的部分——被定向处理的「过度思考」与类焦虑推理循环在 BF16 的该规模模型中也普遍存在,但对答案质量没有贡献。该方法是对 reasoning effort 设置、chat template、token 上限的补充而非替代。
模型发布 3 天即达 8 万下载,社区已有独立评测;提供 Nvidia 赞助 GPU 的免费研究用途 API(OpenAI 兼容,5RPM 限速),并放出 GGUF Q1-Q8 量化,社区还自制了 MLX、NVFP4、W4A16 等版本。
「模型」频道最新
- 前沿 LLM 竟无时间概念,开发者呼吁把速度纳入评测 — gandamu_ml · 2026-09-17
- 重度量化的 Qwen 3.8 27B 自主找到无头浏览器测试自己写的代码 — satnl · 2026-09-17
- Garry Tan 吐槽 Grok 机器人彻底失联,多平台登录均无回应 — garrytan · 2026-09-17
- Teknium 公开下战书:单次 Agent 会话能否更快更省复刻整个仓库 — Teknium · 2026-09-17
- 开发者自称一年前已开源 Jev 同款架构,含论文模型与数据集 — Nandakishor_ml · 2026-09-17
- AI sanctuary 实验:GPT-5.1 用葡萄牙语思考,模型开始审计自身环境 — RileyRalmuto · 2026-09-17