build-eval 加 hillclimb:从生产轨迹自动建 eval,提准同时降成本
Arindam_1729 · x · 2026-09-29
作者介绍 Claude Code 生态里的一套真实可用的 eval 工具组合:build-eval 能从生产轨迹(production traces)自动构建评测,hillclimb 则基于这些评测迭代优化,在提升准确率的同时压低成本。配套内容是 Anthropic Code w/ Claude 大会的一节 45 分钟实操课「Evals for Taste」:现场搭建一个生成幻灯片的 Managed Agent,用 SlidesBench 打分,并根据失败案例迭代 prompt,把「这个看起来不好」变成一个可以优化的数字。作者的观点很直接:发 agent 而不做 eval,等于盲飞。
所属事件:Anthropic 推出 claude-api 自动评测与爬坡优化新命令(5 条相关)→
「编程与Agent」频道最新
- 不给音频只给结构:Jev 零样本预测 2029 通电话,AUC 达 0.78 — alexcovo_eth · 2026-09-30
- Replicas V3 发布:VM 里跑 Claude Code 与 Codex,可自带订阅 — KlausCodes · 2026-09-30
- Agno 智能体框架支持将组件一等公民式发布为 MCP — pritisinghhhh · 2026-09-30
- 开发者谈AI编程:不必为编码手艺哀悼,时间才是真正的瓶颈 — jh3yy · 2026-09-30
- Perplexity 发布 Automations:事件触发与定时执行持续任务 — perplexity_ai · 2026-09-30
- 作者自建 Codex→Flux 3 管线,全自动生成古希腊生活梗图 — venturetwins · 2026-09-30