NeurIPS 2026 论文 SkillRL:7B 模型胜 GPT-4o 41%,靠技能进化
cihangxie · x · 2026-09-25
SkillRL(arXiv:2602.08234)被 NeurIPS 2026 接收。该框架针对 LLM agent 不会从失败中积累技能的问题,提出递归式技能增强强化学习:通过经验蒸馏构建分层技能库 SkillBank、自适应检索通用与任务特定启发式规则,并让技能库在 RL 过程中与策略共同递归进化,从而显著降低 token 占用、提升推理效用。
在 ALFWorld、WebShop 和七项搜索增强任务上取得 SOTA:7B 模型比 GPT-4o 高 41%,训练 token 减少约 20%,收敛快 33%。论文、数据、模型均已开源(arXiv / HuggingFace / GitHub)。
「编程与Agent」频道最新
- Claude Code 2.1.282 更新:移除 claude-haiku-4,提示词再增 21.6% — ClaudeCodeLog · 2026-09-25
- Claude Code 2.1.282 发布:86 项 CLI 改动,修复 400 报错 — ClaudeCodeLog · 2026-09-25
- IDS 论文获 NeurIPS 口头报告:AI 自动生成带形式化证明的分布式系统代码 — AccBalanced · 2026-09-25
- Opus 5.5 加开源脚本 15 分钟全自动做出游戏实机广告视频 — Chemical-Character80 · 2026-09-25
- 斯坦福 CS329Z 开课:把 Agent 工程讲成一门系统科学 — stanfordnlp · 2026-09-25
- Agent 出错后如何还原真相:五步搭建 MCP 全链路可观测体系 — felix_baron · 2026-09-25