LangChain 推出 coding agent 评测技能
BraceSproul · x · 2026-07-23
LangChain 发布了一个新的 Eval Engineering Skill,目标是帮助 coding agents 基于仓库上下文和 agent traces 自动构建评测。
- 这个 skill 已经放在 langchain-ai/langchain-skills 仓库里。
- 可以在 Codex 或 Claude Code 里安装使用。
- 推荐流程是:先用你要评测的 agent 打开目标仓库,再通过 prompt 在 evals/ 下生成任务。
- 然后会得到一个实际的 target run,以及对 verifier 的复核,看看它是否真的测到了想测的行为。
- 这次发布强调的重点,是让 skill 去分析 agent 的结构并挖掘 traces,从而自动化 eval engineering。
所属事件:LangChain 推出 Eval Engineering 助力编程智能体自建评估(6 条相关)→
「编程与Agent」频道最新
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11