LangChain 发布自动化评测技能,助力 Coding Agent 构建 Eval
BraceSproul · x · 2026-08-05
LangChain 发布了全新的 Eval Engineering Skill(评测工程技能),帮助编码智能体基于代码库上下文和生产轨迹自动构建评估标准。
文章指出,由于目标不一致,智能体在单次生成评测环境时的表现往往很差。该技能通过在生成过程中注入人类反馈,并利用三个核心文件进行对齐:
- Harness.md
- Environment.md
- Task.md
工作流程:
- 通过 npx skills add 在 Claude Code、Cursor 等支持 Agent Skills 规范的工具中安装该技能。
- 将技能指向你的代码库和轨迹数据。
- 它会映射整个 Agent 表面,并根据真实生产数据提出评测方向。
- 开发者可提供反馈,随后工具会生成上述三个 Markdown 文件,以明确要模拟的工具类型和数据库等评测细节。
「编程与Agent」频道最新
- 微软开源 Orchard:面向真实环境的 Agent 训练与评测基础设施 — udmrzn · 2026-08-05
- AI 员工部署成新副业:实施专家年入数十万 — omarsar0 · 2026-08-05
- 开源 OpenCode 配置:让 Claude 进化为自学习多智能体 — tom_doerr · 2026-08-05
- Grady Booch:传统软件工程方法可适配 AI Agent 开发 — Grady_Booch · 2026-08-05
- LangChain 发布 CX Agent 实战指南:解析 Lyft 等企业落地经验 — LangChain · 2026-08-05
- 开发者用 Vibe Coding 搓出 FL Studio 克隆:基于 MCP 协议 — Ambitious-Prompt-975 · 2026-08-05