个人微调 Qwen3.8-27B:修复 low 推理反超 medium 的乱序问题

victormustar · x · 2026-10-01

开发者 bytkim 发布 Qwen3.8-27B-pi,一个专门针对 Pi 编码 agent 场景微调的 Qwen3.8-27B。起因是他发现基座模型的 effort 分级失效:low 档的推理 token 反而常比 medium 多,Terminal-Bench 2.1 上 medium 通过率甚至低于 low。

微调分两阶段:

结果:在 Terminal-Bench 2.1、GPQA Diamond、SciCode 上,推理 token 与通过率从 low → medium → xhigh 单调递增。Terminal-Bench 上 Pi 的 medium 档以约 41% 更少输出 token 追平基座 xhigh 的通过率(67/89);SciCode 上 xhigh 档省约 23% 输出 token。已放出 BF16、FP8(30.4 GB)及 17 个 GGUF 变体(9–29 GB)。

所属事件:开发者微调 Qwen3.8-27B-pi 修复推理分级乱序(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →