调低 coding agent 努力档位反而烧更多 token?Qwen3.8-27B-pi 专门训练档位排序
lmoroney · x · 2026-10-06
Coding agent 的 effort 档位未必可信:有时设成 low 反而烧掉更多推理 token、完成任务还更少。
Qwen3.8-27B-pi(面向 Pi coding agent harness 的 Qwen3.8-27B 社区微调版)直接把档位排序当训练目标:
- 第一阶段:用成功、完整的 Pi 会话做监督微调。
- 第二阶段:GRPO 强化学习,奖励先看正确性,再惩罚同一任务上低/中档尝试比成功的高档尝试用更多推理 token 的情况;xhigh 档不做长度压力。
- 作者自报数据:medium 档以约少 41% 的输出 token 达到基座模型 xhigh 档的完成率(自报数字,且基座在 medium 档的某张图上仍占优)。
实用建议:如果 agent 提供档位,用同一任务集在各档位跑一遍,把通过率和 token 数画在一起——两条线都应随档位上升而爬升,否则这个旋钮不可信。
「编程与Agent」频道最新
- 生产环境里怎么改 Agent 权限?Reddit 工程师征集实践方案 — BaraSlim · 2026-10-06
- Armin Ronacher 详解 Codemode:Pi 1.0 为何用代码而非 MCP 工具 — mitsuhiko · 2026-10-06
- T3 Code 上线应用内可视化,Agent 可在会话中构建动态体验 — 0xkarasy · 2026-10-06
- 用 Codex 写连线通信,做出双人对战 Game Boy 涂弹游戏 — pvncher · 2026-10-06
- Codex agent 自动发布 Facebook 帖子并把链接回写 Google Sheets — TawohAwa · 2026-10-06
- ChatGPT 桌面版接入 Zapier SDK,一条指令自动生成并发布社媒内容 — TawohAwa · 2026-10-06