HarnessOpt-Bench 论文发布:评估 LLM 自动优化智能体框架的能力

alex_verem · x · 2026-08-08

arXiv 发布新论文提出 HarnessOpt-Bench,这是一个全新的基准测试,专门用于评估大语言模型(LLM)在端到端智能体框架(Harness)优化任务中的表现。

论文指出,LLM 在智能体系统中的表现不仅取决于模型权重,还高度依赖于提示词、工具、控制流和编排代码等外部框架。该基准要求优化器模型(LLM)在固定的评估预算内,通过迭代修改目标智能体的种子框架来提升其性能。

实验在 4 个下游任务中对 5 个前沿 LLM 进行了 111 次评估,结果表明:不同优化器模型之间的能力差异,比它们所使用的编码框架差异更为显著。

所属事件:ScaleAI推出HarnessOpt-Bench评估大模型优化智能体能力(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →