北大提出新基准评估智能体持续进化能力
针对当前 AI 智能体框架内置显式技能库能带来复利效应的假设,北京大学推出了全新的动态评估框架 ContinualSkillBench。该基准涵盖 5 个代表性领域,专门测试智能体能否真正通过外部技能库实现能力的持续进化。评测结果显示,显式技能库并未显著提升智能体的表现。
2026-08-05 ~ 2026-08-06 · 2 条相关
- 北大提出 ContinualSkillBench:评估智能体持续进化能力 — PekingUniversity · 2026-08-05
- 新基准 ContinualSkillBench 测试:显式技能库并未显著提升 AI 智能体表现 — dair_ai · 2026-08-06