LangSmith 上线 Jev-as-a-judge:给每条生产 trace 打分的新评测方式

LangChain · x · 2026-09-22

LangChain 宣布 Jev-as-a-judge 正式登陆 LangSmith Evals,主打用低成本模型对开放式 Agent 行为做规模化评测。

核心卖点:

博客回顾了 Agent 评测的演进:2023 年初以代码断言为主(快但只能覆盖可预先穷举的行为),随后 LLM-as-a-judge 补上了灵活性(能对完整 trace 做自由文本推理并按 rubric 打分),但更慢更贵、且结果非确定。Jev 作为「System One」类模型被定位为兼顾速度、成本与覆盖面的 judge,文中还给出了在 LangSmith 的 Evaluators 标签页配置在线评测的步骤。

所属事件:LangChain 推出 Jev-as-a-Judge:更快更省的 Agent 评测新方案(9 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →