ScaleAI HarnessOpt-Bench:评估LLM自动优化智能体框架的能力
ScaleAI · hf · 2026-08-07
ScaleAI推出HarnessOpt-Bench,用于衡量前沿LLM在端到端harness优化中的表现。优化器(LLM+编码harness)接收目标智能体的种子harness、分级评估反馈和固定评估预算,编辑harness并提名最终候选。在4个下游任务上评估5个前沿LLM,共111次评分运行。结果显示优化器模型之间的差异大于其使用的编码harness,原生harness并非始终更优,且增益因任务和种子状态而异。该基准确立了harness优化作为可测量、有区分度的能力。
「编程与Agent」频道最新
- Cloudflare 发布 Kitesurf:专为 AI 智能体打造的无头浏览器 — dinasaur_404 · 2026-08-07
- Stripe 招兵买马:为 AI 智能体打造自主软件购买工具 — jeff_weinstein · 2026-08-07
- MiniMax H3 视频无缝拼接技术:动作与音频跨片段连续 — Sad_Berry_4621 · 2026-08-07
- 提取 Meta 智能体系统提示词,Cline 修复 Bug 效率暴增 — alejandroll10 · 2026-08-07
- Aeon:无需人工审批的全自动 Agent 框架 — tom_doerr · 2026-08-07
- Loomline:不止于写代码,AI实现全生命周期软件交付 — jiqizhixin · 2026-08-07