Anthropic 发布官方指南:用 Claude Code 自动构建 eval 并迭代优化
ClaudeDevs · x · 2026-09-29
Anthropic(claude.dev 博客,作者 Lance Martin)为 claude-api skill 新增两条命令,让 Claude Code 能在代码库内自动构建评测并据此优化应用:
- /claude-api build-eval:在代码库中搭建评测集
- /claude-api hillclimb:针对评测逐次改进应用,并用 held-out 样本集防止过拟合自欺
文章总结了好的 eval 设计原则:
- 任务须贴近生产分布,不要因为任务好生成、好打分而选它
- 更强模型应得更高分:如果强模型反而分数低,多半是任务含糊或打分器校准不当
- 前沿处须留有通过率空间:最强模型在最高 effort 下也应明显低于 100%,否则无法可靠判断改动的影响
这是 Anthropic 官方给出的 eval 工程与 agent 迭代工作流实践指南。
所属事件:Anthropic 推出 Claude Code 自动构建评测并迭代优化指南(2 条相关)→
「编程与Agent」频道最新
- Sierra 推出 Ghostwriter:企业 AI Agent 搬进 Slack 主动找你干活 — ZackRW · 2026-09-29
- 开发者用两天后感叹:Claude 太强,Codex 设计拉胯 — cneuralnetwork · 2026-09-29
- TradingView MCP 开源:让 Claude 和 Cursor 直连实时行情与回测 — tom_doerr · 2026-09-29
- 用 Opus 5.5 搓出第三人称 MOBA,LoL/DOTA/风暴英雄混战 — TAbrodi · 2026-09-29
- 用 Claude Code 写「自动化 ROI 顾问」技能,测算出 63000% 回报 — ricoesrico · 2026-09-29
- 不用任何 App:纯 JavaScript 让海报上加载 15MB 脑连接体 3D 模型 — Dr_Alex_Crimi · 2026-09-29