ScaleAI推出HarnessOpt-Bench评估大模型优化智能体能力

ScaleAI 发布全新基准测试 HarnessOpt-Bench,专门用于评估大语言模型在端到端智能体框架优化任务中的表现。该基准要求优化器接收目标智能体的种子框架及分析数据,以此衡量前沿 LLM 自动优化智能体工作流的能力,为相关研究提供了标准化评测工具。

2026-08-07 ~ 2026-08-08 · 2 条相关