HarnessEval 发布:将基准测试转化为智能代理工作流
ziqi_huang_ · x · 2026-08-19
MirroSai 发布了开源评测框架 HarnessEval,旨在将传统的静态基准测试转化为动态的智能代理工作流。该框架利用代理主动解释上下文,将高层评估问题分解为子问题,并调用工具生成子代理,以精准定位模型失败原因并输出可验证的推理轨迹。首个针对视觉生成世界模型的代理评测基准 HarnessEval-W 已随代码、技能库和案例一同开源。
所属事件:HarnessEval 开源框架将基准测试升级为智能代理工作流(4 条相关)→
「研究」频道最新
- Claude 蛋白设计成功率超 93%,实验验证有效 — ferruz_noelia · 2026-08-19
- 论文对比六种 WebGPU 地形渲染方法 — ssh4net · 2026-08-19
- 参数量存在阈值?观点称后训练才是未来能力增量关键 — cephaloform · 2026-08-19
- 追踪 12 团队一学期,TIDES 数据集探索多角色协作动态 — josephseering · 2026-08-19
- Maglev 架构:用滑动循环记忆解决 Transformer 遗忘难题 — anselm · 2026-08-19
- 8 个月多 Agent 实战:持久化内存是文件柜问题 — __hymn · 2026-08-19