个人微调 Qwen3.8-27B-pi:修复推理力度乱序,省 41% token
victormustar · x · 2026-10-01
一位独立开发者在租用的 GPU 上微调出 Qwen3.8-27B-pi,专攻 Pi 编码 agent 场景。出发点很实际:基座模型的 reasoning 力度(levels)乱序——low 比 medium 花更多 token,Terminal-Bench 2.1 上 medium 通过率反而低于 low。方法分两阶段:
- SFT:用筛选过的成功 Pi 会话数据,教会完整编码工作流(读仓库、改文件、跑工具、依据反馈迭代)
- RL(GRPO):以任务成功为条件的奖励,并要求低力度在同任务上的推理长度不得超过高力度
结果:力度排序在 Terminal-Bench 2.1、GPQA Diamond、SciCode 上均成立(非递减)。Terminal-Bench 上 Pi 的 medium 追平基座的 xhigh(67/89),输出 token 约省 41%;SciCode 的 xhigh 省 23%。已发布 BF16、FP8(30.4 GB)及 17 个 GGUF 变体。
所属事件:开发者微调 Qwen3.8-27B-pi 修复推理分级乱序(2 条相关)→
「编程与Agent」频道最新
- Codex dots 接入 ChatGPT 上下文,新 dot 开箱即懂你的历史对话 — dkundel · 2026-10-01
- 数学家自述用 Codex CLI+Claude Code 做 agentic 数学,代数几何新结果在即 — burny_tech · 2026-10-01
- Fathom:不止记忆,给 Agent 做「个性化」系统的开源尝试 — allisonmaybe · 2026-10-01
- 众包本地模型榜单 airbench:一条 prompt 让你的 Agent 帮跑分 — dh7net · 2026-10-01
- Vercel Ship SF 议程曝光:Notion 智能体平台、Grok 驱动 30 万应用等议题 — evilrabbit_ · 2026-10-01
- 微软 Foundry 系列开篇:模型越强,内容抽取层越不可省 — adnan_hashmi · 2026-10-01