新基准 ContinualSkillBench 测试:显式技能库并未显著提升 AI 智能体表现

dair_ai · x · 2026-08-06

当前许多 AI 智能体框架开始内置技能库,假设将技能显式记录下来能带来复利效应。为此,新评测基准 ContinualSkillBench 应运而生,专门测试这一假设。

该基准涵盖 5 个领域,每个领域包含 100 个按难度递增且具有跨任务技能复用机会的子任务。测试发现,虽然按顺序执行任务总体上能提升模型表现,但提升幅度因模型和领域而异。

核心结论是:维护显式技能库的表现与普通的上下文学习(in-context learning)相当。大部分性能提升实际上来自于模型对先前上下文和反馈的适应,而非真正复用了抽象技能。不过,在需要可复用流程或精确输出的特定任务中,显式技能依然有效。此外,结果还揭示了一个现象:能力较弱的模型往往会积累更多、更碎片化的特定任务技能。

所属事件:北大提出新基准评估智能体持续进化能力(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →