LangSmith 上线 Jev-as-a-judge:给每条生产 trace 打分的新评测方式
LangChain · x · 2026-09-22
LangChain 宣布 Jev-as-a-judge 正式登陆 LangSmith Evals,主打用低成本模型对开放式 Agent 行为做规模化评测。
核心卖点:
- 对每一条生产 trace 全量打分,而非抽样评估
- 单条 trace 可检查更多判据,成本不随判据数上涨
- 能及时发现安全或安全问题,快到可触发自动响应
博客回顾了 Agent 评测的演进:2023 年初以代码断言为主(快但只能覆盖可预先穷举的行为),随后 LLM-as-a-judge 补上了灵活性(能对完整 trace 做自由文本推理并按 rubric 打分),但更慢更贵、且结果非确定。Jev 作为「System One」类模型被定位为兼顾速度、成本与覆盖面的 judge,文中还给出了在 LangSmith 的 Evaluators 标签页配置在线评测的步骤。
所属事件:LangChain 推出 Jev-as-a-Judge:更快更省的 Agent 评测新方案(9 条相关)→
「编程与Agent」频道最新
- 用 GPT Vision + Jev 搭颜值打分器:三步流程实测与踩坑 — huangyun_122 · 2026-09-22
- GitHub Actions 限流太烦,开发者自建 dsr 本地接管发布流程 — doodlestein · 2026-09-22
- Nous 发布官方插件:Claude Pro/Max 订阅可直接驱动 Hermes Agent — Teknium · 2026-09-22
- 开源 jevmail:3 美分本地分拣 1000 封 Gmail,只读保护隐私 — _AustinCalvert_ · 2026-09-22
- 数据中心金融 Agent Kos 获 8VC 领投 1200 万美元融资 — ahelkky · 2026-09-22
- LangChain 创始人看好 decision models:Agent 就是围绕模型的工程 — Hacubu · 2026-09-22