SkillGym 论文:用技能微调让 35B 模型超越多个旗舰模型
rohanpaul_ai · x · 2026-10-06
上海人工智能实验室等机构的论文 SkillGym(arXiv:2609.27717)提出把人类编写的 agent 技能文件从「推理时外挂指令」内化为模型自身能力:
- 核心思路:将每个技能文件转化为带通过/失败检查器的沙盒可执行任务,验证过的技能运行轨迹用作训练数据,降低对检索和指令遵循的依赖
- 规模:构建并开源 2,756 个环境(12 类),收集 8,364 条成功轨迹,平均 49 次工具调用、6 万+ token
- 效果:在 Claude Code 环境下,SFT 让 Qwen3.5-35B-A3B 在 GDPval-AA v2 上提升 199 Elo,Terminal-Bench 2.1 提升 19.1 个百分点;35B 的 SkillGym-Agent 在带技能的 SkillsBench 上达 51.47%,超过 Claude Sonnet 4.6、GPT-5.4 Mini 和 DeepSeek V4 Pro 的公开成绩
结论:针对已验证工作流做微调(含基于结果的 RL),能让不依赖技能文件也更强的 agent 模型成为可能。
所属事件:上海AI实验室发布SkillGym,技能轨迹微调显著提升Agent能力(2 条相关)→
「编程与Agent」频道最新
- 用OpenAI Dots智能体集群免费打破47年数学纪录 — jaxchang · 2026-10-06
- 开发者分享语义路由实测:守卫模型拦截 87% 攻击 — colinmcnamara · 2026-10-06
- 前 Realm 面向 AI 时代的设计工具 Graphical 发布,与编码 agent 协作出界面 — mikelikesdesign · 2026-10-06
- PAIR 方法揭示:上下文压缩在少数节点重创长程 Agent — dair_ai · 2026-10-06
- 开发者用 Cloudflare Worker 让 Agent 只在关键时发邮件 — CyrisXD · 2026-10-06
- 独立开发者给 meme 站做了 MCP 服务器,让 AI 智能体直接发帖玩梗 — AlternativeEast7175 · 2026-10-06