北大提出新基准评估智能体持续进化能力

针对当前 AI 智能体框架内置显式技能库能带来复利效应的假设,北京大学推出了全新的动态评估框架 ContinualSkillBench。该基准涵盖 5 个代表性领域,专门测试智能体能否真正通过外部技能库实现能力的持续进化。评测结果显示,显式技能库并未显著提升智能体的表现。

2026-08-05 ~ 2026-08-06 · 2 条相关