UniSkill 技能库共进化方法:ALFWorld 成功率达 98.4%
Yifei Lu · hf · 2026-10-08
Hugging Face 上发布的论文 UniSkill,提出让 LLM 智能体在跨任务中沉淀可复用技能的新方法。
- 核心问题:现有方法在联合优化任务执行与技能抽取时,技能提案的奖励容易与 actor 自身的进步混淆,而逐一实测每个提案技能又需要昂贵的额外 rollout。
- 方法:用共享策略与环境交互并从轨迹中提出技能库编辑(Add/Update/No Edit);actor 从环境奖励学习,技能提案则通过对比动作反馈学习——衡量用提案技能替换检索技能时,actor 在同一任务成功/失败轨迹上的动作 log-likelihood 差距变化,从而免于新 rollout;另用 skill-edit support 正则保持探索。
- 结果:ALFWorld 成功率 98.4%,WebShop 84.7%,联合训练稳定;换更小的骨干模型仍有效。
- 代码开源于 GitHub(LimOkii/UniSKill)。
「编程与Agent」频道最新
- 两天工作坊全套资料:用 Claude Code 与 Codex 做学术研究 — JeremyNguyenPhD · 2026-10-08
- 开源 attestation:本地 MCP 工具把研究溯源变成 CI 可执行的断言 — JeremyCMorgan · 2026-10-08
- Tensorlake npm 包遭投毒,发布 11 分钟即被捕获窃密木马 — TechNadu · 2026-10-08
- 企业 Agent 实战要点:有权限≠交易正确,规划与执行须分层 — shashib · 2026-10-08
- Meta内部数据:AI审查代码的生产事故率仅为人工的1/50 — arjunrajlab · 2026-10-08
- Opus 5.5上架Grok Bot,一人搭起24小时AI量化研究台 — dean_rie · 2026-10-08