首个评估 LLM 自主优化框架能力的基准 Evo-Bench

RUC-AIBOX · hf · 2026-08-11

Evo-Bench 是首个专门评估大语言模型(LLM)自主优化智能体框架能力的基准测试。现有评估通常只关注静态任务,难以将框架优化的效果与基础模型的能力区分开。

为了解决这一痛点,Evo-Bench 引入了新颖的框架引导构建体系:

该基准覆盖了搜索、办公和通用智能体三大领域,对 9 个前沿与开源模型进行了广泛评估。结果显示,头部模型通过自主进化获得了高达 16.6 分的绝对提升,逼近人类手工设计的基线。此外,分析发现:自主进化在通用和搜索任务中表现优异,但在需要特定工作流的办公任务中表现吃力;同时存在早期饱和等时间异常现象。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →