LangChain 推出 Jev 评测器:打分方差低 92-913 倍,成本仅 0.34 美元
LangChain · x · 2026-09-20
LangChain 发布文章《Jev-as-a-Judge for Agent Evals》,介绍一种新型 agent 评测器 Jev:
- 机制不同:Jev 直接返回结构化类型答案,而非像 LLM judge 那样生成文本,避开了现有 LLM judge 慢、贵、不稳定的缺陷
- 一致性大幅提升:在连续打分任务上,其质量分方差比 GPT-5.6 Luna/Terra 和 Claude Sonnet 4.6 低 92–913 倍
- 更快更便宜:平均每次调用 0.44 秒、0.00035 美元;整批测试总成本 0.34 美元,对比 Claude 的 28.17 美元
- 背景:现有 agent 评测分代码式与 LLM-as-judge 两类,前者只适用于输入固定的窄问题,后者可靠性存疑。作者称结果虽是早期窄域测试,但指出了 agent eval 的新方向
「编程与Agent」频道最新
- 开发者选 C 写新引擎:不为 AI,只为完全掌控与处处可绑定 — gdechichi · 2026-09-20
- 开发者视角:模型日产百万行代码,外行惊叹内行视作 slop — BLUECOW009 · 2026-09-20
- chatpipe-mcp:让 AI 编码 Agent 一键发布带密码保护的在线页面 — modelcontextprotocol · 2026-09-20
- AI CTO 演讲:各代人已用助手取代 Chrome,需重构 Web — EdenEmarco177 · 2026-09-20
- Mac 绘图应用接入 MCP 服务器测试工具,意外成为杀手级功能 — DrawSimple_for_MacOS · 2026-09-20
- Hugo Bowne 推出免费 30 分钟闪电课:AI Agent Evals 怎么测 — hugobowne · 2026-09-20