个人微调 Qwen3.8-27B-pi:修复推理力度乱序,省 41% token

victormustar · x · 2026-10-01

一位独立开发者在租用的 GPU 上微调出 Qwen3.8-27B-pi,专攻 Pi 编码 agent 场景。出发点很实际:基座模型的 reasoning 力度(levels)乱序——low 比 medium 花更多 token,Terminal-Bench 2.1 上 medium 通过率反而低于 low。方法分两阶段:

结果:力度排序在 Terminal-Bench 2.1、GPQA Diamond、SciCode 上均成立(非递减)。Terminal-Bench 上 Pi 的 medium 追平基座的 xhigh(67/89),输出 token 约省 41%;SciCode 的 xhigh 省 23%。已发布 BF16、FP8(30.4 GB)及 17 个 GGUF 变体。

所属事件:开发者微调 Qwen3.8-27B-pi 修复推理分级乱序(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →