Skill Self-Play 用共进化技能提升 LLM 能力上限
QwenBusinessUnit-Edu · hf · 2026-07-27
- 这篇工作讨论 LLM 自我进化训练中的一个核心矛盾:环境绑定方法反馈更可靠但任务面太窄,而开放式自生成任务更丰富却难以可靠验证。
- 作者提出 Skill Self-Play(Skill-SP),把“agent skill”作为兼顾多样性与可验证性的中间层。
- 框架由三个部分组成:proposer、solver、dynamic skill controller。
- 在强化学习循环中,proposer 基于动态采样的技能生成任务,solver 尝试解题,controller 则根据执行反馈更新并扩展技能库。
- 实验显示它在工具使用和推理基准上都能稳定提升表现,对一些初始对齐较差的模型也能带来明显改善。
- 代码已开源。
所属事件:阿里 Qwen 推出 Skill Self-Play 共演化训练框架(3 条相关)→
「编程与Agent」频道最新
- Drew Breunig:写 Agent 指令更像立法,而非下棋 — dbreunig · 2026-09-23
- Seroter 日报:GPT-6 与 Opus 5.5 同日发布,1/4 智能体无人监控 — rseroter · 2026-09-23
- 让 Claude 自动开终端面板装依赖,作者称 tmux 做不到 — letandrewcook · 2026-09-23
- 两小时做出幼儿互动绘本:Agent 访谈式工作流走红 — mimi10v3 · 2026-09-23
- 观点:软件正从"被人操作"变为"自己会用软件" — r0ck3t23 · 2026-09-23
- 模型能力不是拿来堆 10 倍功能,而是换成更深的产品理解 — trq212 · 2026-09-23