北大提出 ContinualSkillBench:评估智能体持续进化能力

PekingUniversity · hf · 2026-08-05

北京大学推出了全新的动态评估框架 ContinualSkillBench,旨在测试 LLM 智能体能否真正通过外部技能库实现能力的持续进化。

该基准涵盖 5 个代表性领域,每个领域包含 100 个按难度递增且支持跨任务技能复用的子任务。实验揭示了以下几点核心发现:

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →