Anthropic 发布 claude-api skill 新命令:自动构建评测并逐次爬坡优化
RLanceMartin · x · 2026-09-29
Lance Martin(Anthropic)发布长文,介绍 claude-api skill 新增的 eval 设计与 hillclimbing 能力。
核心命令
- /claude-api build-eval:直接在代码库中构建评测
- /claude-api hillclimb:基于评测逐项改进应用,并使用 held-out 样本集防止过拟合
评测设计原则
- 任务应采样自真实生产场景,而非贪图易生成、易打分
- 更强模型和更高思考强度应当带来更高分数,若不然,往往说明任务含糊或打分器校准有问题
- 最强模型在最高 effort 下也应明显低于 100% 通过率,留出可测量的提升空间,且差距不能由无关因素解释
文章先讲清这些原则,再演示 Claude Code 如何借助 skill 将其自动化落地,并给出多个命令实例。
所属事件:Anthropic 推出 Claude Code 自动构建评测并迭代优化指南(2 条相关)→
「编程与Agent」频道最新
- AI 建筑师自作主张无视需求,张口索要 1100 万英镑设计费 — snikolov · 2026-09-29
- 开发者用 Opus 全部 token 打造 three.js 程序化动物素材包 — majidmanzarpour · 2026-09-29
- 多模型同开一个 Codex 会话,Jev 自动路由分工写全栈应用 — omarsar0 · 2026-09-29
- 手绘风动画纯靠 HTML5 Canvas 写出,作者惊叹 Opus 5.5 编码力 — Ror_Fly · 2026-09-29
- Stripe 高管:直接向用户的 AI Agent 收集集成反馈 — hazelcough · 2026-09-29
- 让 Opus 做最终剪辑与后期,还自选字体设计收尾动画 — techhalla · 2026-09-29