ScaleAI HarnessOpt-Bench:评估LLM自动优化智能体框架的能力

ScaleAI · hf · 2026-08-07

ScaleAI推出HarnessOpt-Bench,用于衡量前沿LLM在端到端harness优化中的表现。优化器(LLM+编码harness)接收目标智能体的种子harness、分级评估反馈和固定评估预算,编辑harness并提名最终候选。在4个下游任务上评估5个前沿LLM,共111次评分运行。结果显示优化器模型之间的差异大于其使用的编码harness,原生harness并非始终更优,且增益因任务和种子状态而异。该基准确立了harness优化作为可测量、有区分度的能力。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →