LangChain 推出 Jev 评测裁判:比 Claude 便宜 80 倍、快 5 倍
LangChain · x · 2026-09-22
LangChain 发布 Jev-as-a-judge 并上线 LangSmith,用专用工具替代 LLM 作为 agent 评测裁判。
官方测试数据(对比 GPT-5.6 Luna、GPT-5.6 Terra 和 Claude Sonnet 4.6):
- 每次判定均与人类评审一致,方差最高低 913 倍
- 单次判定 0.44 秒,LLM 为 2.16-2.83 秒
- 全量评测成本 $0.34,用 Claude Sonnet 4.6 需 $28.17
官方称可对全部生产 trace 逐条打分而非抽样、在单条 trace 上检查更多标准而成本不失控,并能足够快地发现安全/安全问题以触发自动响应。
所属事件:LangChain 推出 Jev-as-a-Judge:更快更省的 Agent 评测新方案(9 条相关)→
「编程与Agent」频道最新
- 数据中心金融 Agent Kos 获 8VC 领投 1200 万美元融资 — ahelkky · 2026-09-22
- LangChain 创始人看好 decision models:Agent 就是围绕模型的工程 — Hacubu · 2026-09-22
- LangSmith 集成 Jev:低成本大规模 trace 挖掘,直接产出 eval — hwchase17 · 2026-09-22
- Shopify 全面接入 Muse 代理结账,CEO 暗讽 Amazon 护广告业务 — firstadopter · 2026-09-22
- 如何在本地、预发、评审间切换编码 Agent 的访问配置? — radim11 · 2026-09-22
- 开源后训练框架 Halo 发布:吞吐达 TRL 2.8 倍且更省显存 — _akhaliq · 2026-09-22