北大提出 ContinualSkillBench:评估智能体持续进化能力
PekingUniversity · hf · 2026-08-05
北京大学推出了全新的动态评估框架 ContinualSkillBench,旨在测试 LLM 智能体能否真正通过外部技能库实现能力的持续进化。
该基准涵盖 5 个代表性领域,每个领域包含 100 个按难度递增且支持跨任务技能复用的子任务。实验揭示了以下几点核心发现:
- 上下文学习效果显著:按顺序执行任务通常能提升表现,且单纯的上下文学习(In-context learning)效果与显式技能维护平均相当。这意味着很多提升其实源于模型对历史上下文和反馈的适应,而非真正提取了可复用的技能。
- 显式技能的特定优势:对于需要精确输出或可复用流程的任务,显式技能依然具备不可替代的作用。
- 弱模型的技能碎片化:能力较弱的模型往往倾向于积累大量零散且特定于单一任务的技能,难以将其整合为稳健、可迁移的通用技能。
所属事件:新基准测试表明显式技能库未显著提升AI智能体(3 条相关)→
「编程与Agent」频道最新
- Agent Substrate 发布:快到可按每次工具调用挂起与恢复 — jonathangrahl · 2026-09-21
- 用 logprobs 把任意本地 LLM 变成分类器,附带完整命令 — DivideHorror3217 · 2026-09-21
- Ruff 作者自述:2025 年 12 月才开始真正用 Agent,距今不到一年 — charliermarsh · 2026-09-21
- 开源 LLaMA-Factory 支持 100+ 模型微调,200 条数据可胜大模型 — Roger_M_Taylor · 2026-09-21
- SWE-2 限时免费开放至 10 月 8 日,覆盖 Devin 全系产品 — silasalberti · 2026-09-21
- Delta 与 OpenTable 封禁 AI 代理下单,用户抱怨「这是未来」 — Scobleizer · 2026-09-21