build-eval 加 hillclimb:从生产轨迹自动建 eval,提准同时降成本

Arindam_1729 · x · 2026-09-29

作者介绍 Claude Code 生态里的一套真实可用的 eval 工具组合:build-eval 能从生产轨迹(production traces)自动构建评测,hillclimb 则基于这些评测迭代优化,在提升准确率的同时压低成本。配套内容是 Anthropic Code w/ Claude 大会的一节 45 分钟实操课「Evals for Taste」:现场搭建一个生成幻灯片的 Managed Agent,用 SlidesBench 打分,并根据失败案例迭代 prompt,把「这个看起来不好」变成一个可以优化的数字。作者的观点很直接:发 agent 而不做 eval,等于盲飞。

所属事件:Anthropic 推出 claude-api 自动评测与爬坡优化新命令(5 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →