ScaleAI推出HarnessOpt-Bench评估大模型优化智能体能力
ScaleAI 发布全新基准测试 HarnessOpt-Bench,专门用于评估大语言模型在端到端智能体框架优化任务中的表现。该基准要求优化器接收目标智能体的种子框架及分析数据,以此衡量前沿 LLM 自动优化智能体工作流的能力,为相关研究提供了标准化评测工具。
2026-08-07 ~ 2026-08-08 · 2 条相关
- ScaleAI HarnessOpt-Bench:评估LLM自动优化智能体框架的能力 — ScaleAI · 2026-08-07
- HarnessOpt-Bench 论文发布:评估 LLM 自动优化智能体框架的能力 — alex_verem · 2026-08-08