专题 · FULL STORY

Jev-as-a-Judge:从发文到登陆 LangSmith

LangChain 于 9 月 20 日发布 Jev-as-a-Judge 智能体评估方法,随后宣布其正式集成到 LangSmith 平台,支持对生产轨迹进行低成本逐条评估,创始人亦转发推广,完成从介绍到上线的一步到位落地。

2026-09-20 ~ 2026-09-22 · 2 集 · 11 条

第 1 集 · LangChain 推出 Jev-as-a-Judge 并上线 LangSmith(2026-09-20,9 条)

9 月 20 日,LangChain 发布文章《Jev-as-a-Judge for Agent Evals》(Daniel Shea、Seán Roche 撰写,联合创始人 Harrison Chase 与 swyx 转发推荐),提出用全新评估器 Jev 替代 LLM-as-a-Judge 做线上 agent 评测;9 月 22 日,Jev-as-a-judge 正式上线 LangSmith Evals,成为可对生产流量全量打分的评测方式。

已确认

  • Jev 是机制根本不同的评估器:直接返回带类型的结构化答案,而不像 LLM judge 那样先生成文本再解析,从而避开文本解析带来的不确定性
  • LangChain 官方对比测试覆盖 GPT-5.6 Luna、GPT-5.6 Terra 和 Claude Sonnet 等模型,在准确率、可重复性、延迟和成本四个维度比较:打分方差比 LLM judge 低 92-913 倍,速度最快可达 5 倍,成本最多节省 99%,单次评估约 0.34 美元,比 Claude 便宜 80 倍
  • 9 月 22 日起 Jev-as-a-judge 登陆 LangSmith Evals,主打对每一条生产 trace 全量打分而非抽样评估,用低成本方案对开放式 Agent 行为做规模化评测
  • 团队成员 Sydney Runkle 发布博客《Building a Harness with Jev》,介绍在 agent 循环(LLM 决策→工具执行→模型评估)中用 Jev 搭建评估工具的实践,并在后续转发中补充了博客未展开的用法
  • AI Evals 领域知名作者 Hamel Husain 回应「能不能用 Jev 做评测」时表示可以,并指出 LLM Judge 本质上就是一个分类器,因此关键不在用哪个模型,而在方法——务必用人工标注来验证分类器,避免过拟合

为什么重要

  • LLM-as-a-Judge 长期受打分不稳定、成本高、速度慢困扰,Jev 以结构化输出路线提供了更廉价、快速、稳定的语义验证替代方案,尤其适合线上持续评测 agent 表现;登陆 LangSmith 后,从博客方案变为开箱即用的生产评测能力
  • 有转发者认为这类廉价验证器还可能缓解强化学习中的奖励验证瓶颈
  • Hamel Husain 的补充提醒从业者:无论用哪种评估器,都应结合人工标注验证,防止评估方法本身过拟合

第 2 集 · LangSmith 上线 Jev-as-a-judge 低成本评估(2026-09-22,2 条)

LangChain 宣布 Jev-as-a-judge 在 LangSmith 平台正式上线,创始人 hwchase17 也转发推广。该集成支持对每条生产 trace 进行全量评分而非抽样,可在每个 trace 上检查更多评判标准而成本不增,实现低成本的大规模 trace 挖掘,并直接产出 eval 结果。