Skill Self-Play 用共进化技能提升 LLM 能力上限
QwenBusinessUnit-Edu · hf · 2026-07-27
- 这篇工作讨论 LLM 自我进化训练中的一个核心矛盾:环境绑定方法反馈更可靠但任务面太窄,而开放式自生成任务更丰富却难以可靠验证。
- 作者提出 Skill Self-Play(Skill-SP),把“agent skill”作为兼顾多样性与可验证性的中间层。
- 框架由三个部分组成:proposer、solver、dynamic skill controller。
- 在强化学习循环中,proposer 基于动态采样的技能生成任务,solver 尝试解题,controller 则根据执行反馈更新并扩展技能库。
- 实验显示它在工具使用和推理基准上都能稳定提升表现,对一些初始对齐较差的模型也能带来明显改善。
- 代码已开源。
「编程与Agent」频道最新
- Codex 循环线程开始每周自动做诗歌点评和清单整理 — andrew_n_carr · 2026-07-27
- AI agent 账单飙到 1279 美元,团队开始吐槽该裁掉谁 — HaktanSuren · 2026-07-27
- NVIDIA 开源 Molt:面向 Agentic 强化学习的训练框架 — nvidia · 2026-07-27
- Discord 截图显示视频生成器卡在“thinking”状态 — beechinour · 2026-07-27
- 用 Claude Code 做的 LSAT 错题网站,支持题目讨论线程 — Isaiah-Burton · 2026-07-27
- Victor Taelin 给 agent 记忆系统加入树状展开与长程回忆 — AccBalanced · 2026-07-27