Qwen 提出技能自博弈框架,模型工具调用能力提升 42 点
May_F1_ · x · 2026-08-03
阿里 Qwen 团队发布论文提出 Skill Self-Play (Skill-SP) 框架,旨在解决大模型自我进化中任务多样性与验证可靠性难以兼顾的困境。
该框架引入了持续更新的动态技能库,并在强化学习闭环中设置了三个协作角色:
- Proposer:基于现有技能生成具有挑战性的新任务。
- Solver:尝试解决任务以拓展能力边界。
- Controller:根据执行反馈更新技能库(淘汰过时技能、沉淀新模式)。
实验覆盖 5 个 3B-14B 参数的开放模型。结果显示,模型的工具调用能力最高提升了 42.9 个百分点,逻辑推理能力最高提升 12 个百分点。值得注意的是,技能库仅用于组织训练过程,最终模型在推理时无需读取这些技能包,所学能力已内化于模型本身。
「研究」频道最新
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- 2.7 万学生实证:AI 用得越狠,成绩跌得越惨 — 创业邦 · 2026-08-24
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24