个人微调 Qwen3.8-27B:修复 low 推理反超 medium 的乱序问题
victormustar · x · 2026-10-01
开发者 bytkim 发布 Qwen3.8-27B-pi,一个专门针对 Pi 编码 agent 场景微调的 Qwen3.8-27B。起因是他发现基座模型的 effort 分级失效:low 档的推理 token 反而常比 medium 多,Terminal-Bench 2.1 上 medium 通过率甚至低于 low。
微调分两阶段:
- 用精选的成功 Pi 会话做 SFT,教完整的读仓库、改文件、跑工具流程;
- 用 GRPO 做强化学习,奖励以「任务成功 + effort 有序」为条件:同一任务上,低 effort 的推理 token 不应超过高 effort。
结果:在 Terminal-Bench 2.1、GPQA Diamond、SciCode 上,推理 token 与通过率从 low → medium → xhigh 单调递增。Terminal-Bench 上 Pi 的 medium 档以约 41% 更少输出 token 追平基座 xhigh 的通过率(67/89);SciCode 上 xhigh 档省约 23% 输出 token。已放出 BF16、FP8(30.4 GB)及 17 个 GGUF 变体(9–29 GB)。
所属事件:开发者微调 Qwen3.8-27B-pi 修复推理分级乱序(2 条相关)→
「编程与Agent」频道最新
- Retriever AI 实测 OpenAI Dots:五项日常任务 24/24 力压对手 — quarkcarbon · 2026-10-01
- AI Agent 测评怎么做?开发者晒出抓「假装调用工具」的工具 — mbtigeekjung · 2026-10-01
- 开发者喊话 agent 厂商:别造新入口,去做人类讨厌的事 — SuB8u · 2026-10-01
- 月烧 3000 美元组多模型工作流:白领岗位危险了 — opmgyhx · 2026-10-01
- 让 AI 工具把自己换成更便宜的另一个 AI,开发者直呼爽快 — yacineMTB · 2026-10-01
- 50 人律师团队用 Devin 首响,日处理 20-40 个 bug 噪音减半 — graceisford · 2026-10-01