SkillGym:6800个可验证环境训练技能调用Agent,SFT后9B胜397B
Renxi Wang · hf · 2026-10-01
SkillGym:自动化训练技能使用 Agent
- 问题:skills 已广泛用于 agent 范式,但如何合成可靠训练数据、如何训练 agent 用好技能仍少有人研究。
- 流水线:从互联网爬取大量技能,筛出可离线复现的工作流;用 builder-reviewer 流程构建难度可控任务(4 类任务型),每个任务带参考解与可执行验证器。
- 规模:构建 6800 个环境,收集 1.9 万条经验证的成功轨迹用于 SFT。
- 效果:跨 4 个技能基准、2B–122B 多个模型均提升;Qwen3.5-9B SFT 模型在其中两个基准上超过未训练的 397B 模型。
- 分析:训练显著提升技能调用率(阅读相关技能的比例从 28% 升至 96%),增益跨推理结构、少数任务类型及训练外held-out技能均成立。
「编程与Agent」频道最新
- 睡前给 agent 布置任务,一觉醒来完成 6.5 小时的工作量 — therealdanvega · 2026-10-01
- 前 OpenAI 研究员推出 System One 模型 Jev,结构化决策快百倍 — KhuyenTran16 · 2026-10-01
- Jev 与 PydanticAI 的关键区别:在模型回答前就锁定决策 — KhuyenTran16 · 2026-10-01
- 博主开发海外播客转写 MCP,把播客变成高质量信息源 — vista8 · 2026-10-01
- Abridge 把临床医生反馈变成可量化评测体系,加速 agent 迭代 — LangChain · 2026-10-01
- 开发者的硬观点:不能阻止合并的 eval,只是装饰品 — bgoncalves · 2026-10-01