LangChain 推出 coding agent 评测技能
BraceSproul · x · 2026-07-23
LangChain 发布了一个新的 Eval Engineering Skill,目标是帮助 coding agents 基于仓库上下文和 agent traces 自动构建评测。
- 这个 skill 已经放在 langchain-ai/langchain-skills 仓库里。
- 可以在 Codex 或 Claude Code 里安装使用。
- 推荐流程是:先用你要评测的 agent 打开目标仓库,再通过 prompt 在 evals/ 下生成任务。
- 然后会得到一个实际的 target run,以及对 verifier 的复核,看看它是否真的测到了想测的行为。
- 这次发布强调的重点,是让 skill 去分析 agent 的结构并挖掘 traces,从而自动化 eval engineering。
所属事件:LangChain发布Eval Engineering助力编程智能体评估(3 条相关)→
「编程与Agent」频道最新
- 实测 Gemini 3.5 Flash-Lite:文档提取比 Claude 便宜 71 倍 — rseroter · 2026-07-23
- Cohere将办演讲:探讨LLM智能体可靠性与不确定性信号 — Cohere_Labs · 2026-07-23
- LangChain 和 Cognition 将办 agent 开放记忆活动 — LangChain · 2026-07-23
- Factory 联创预测:未来两年内 90% 的编程 Agent 将实现完全自主 — matanSF · 2026-07-23
- 语音助手把后端迁到欧洲后,工具调用立刻变快 — ur_piyo_a_hoe · 2026-07-23
- W&B 的 Scott Condron 想重回开发者关系:押注研究代理与评测界面 — _ScottCondron · 2026-07-23