SkillLift 用学习式评分替代真实 rollout,agent 技能进化省 40-70% token
dair_ai · x · 2026-09-22
dair-ai 介绍论文 SkillLift:一种更省成本的 agent 技能自我进化方法,相比前沿进化方法减少 40–70% token 开销。
- 核心问题:技能自进化通常只修补已观测到的失败,因为每评估一次候选修改都要跑一次真实 agent rollout,成本高昂。
- 思路:用学到的 rubric 对候选技能做排序,而非逐个 rollout 打分——排序所需的 oracle 次数远少于逐个预测分数。
- 双层循环:内循环针对冻结的 rubric 修改技能,零 rollout 成本;外循环用少量真实 rollout 通过秩相关性重新对齐 rubric。
- 结果:在 SkillsBench 和 WildClawBench(147 个任务)上、跨三个模型,六个组合全部击败 SkillOpt 与 CoEvoSkills。
「编程与Agent」频道最新
- Exa MCP 突破 5000 GitHub 星,成 AI Agent 生态热门接入层 — TheIshanGoswami · 2026-09-22
- 扫描 67 万 agent skills:69% 不可靠触发且缺乏信任层 — markjeffrey · 2026-09-22
- 无法回放环境怎么训 RL?从单轨迹学习或成持续学习关键 — rhythmrg · 2026-09-22
- Agent 过了评测还不够:Anthropic「瑞士奶酪模型」谈多层质检盲区 — hugobowne · 2026-09-22
- OpenAI 艺术家团队全员用上 Codex,两周内普及率 100% — andrew_n_carr · 2026-09-22
- PyTorch 官方推 TinyTorch:20 模块纯 Python 从零造 ML 框架 — PyTorch · 2026-09-22