Qwen 提出技能自博弈框架,模型工具调用能力提升 42 点

May_F1_ · x · 2026-08-03

阿里 Qwen 团队发布论文提出 Skill Self-Play (Skill-SP) 框架,旨在解决大模型自我进化中任务多样性与验证可靠性难以兼顾的困境。

该框架引入了持续更新的动态技能库,并在强化学习闭环中设置了三个协作角色:

实验覆盖 5 个 3B-14B 参数的开放模型。结果显示,模型的工具调用能力最高提升了 42.9 个百分点,逻辑推理能力最高提升 12 个百分点。值得注意的是,技能库仅用于组织训练过程,最终模型在推理时无需读取这些技能包,所学能力已内化于模型本身。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →