开源项目 jevals:用 JEV 式决策模型在本地跑 agent 评估
byebaybay · reddit · 2026-09-24
开发者发布了开源项目 jevals,主张用 JEV 风格的决策模型(本质是一次性分类器)替代昂贵的 LLM-as-a-judge 来做 agent 评估。核心论点:
- 成本与延迟:LLM 评审在百万到十亿次决策规模下生成文本代价过高;作者曾用 OpenAI 并行方案加速 Ragas 仍遇瓶颈,agent 循环内问题更严重,本地分类器可绕开
- 泛化能力:可通过自然语言问题适配的分类器,无需为每个任务单独微调
- 选对工具:分类与回归从未过时,只是被文本生成热潮掩盖——输出是标签、概率或分数的问题不该用生成模型
项目已开源,作者征集在真实数据上的反馈。
所属事件:前苹果工程师开源 Agent 评测工具 jevals(2 条相关)→
「编程与Agent」频道最新
- 「读发票」和「转账」权限必须分开:AI agent 授权设计四原则 — TechNadu · 2026-09-24
- Comfy Router 上线:一个 API 统一调用图像视频 3D 音频模型 — cpaik · 2026-09-24
- agent 绕过插件改用 computer use?在 AGENTS.md 里写死优先级 — jdjohnson · 2026-09-24
- Hamel Husain 撰文厘清 AI Evals:模型基准与产品评测是两回事 — HamelHusain · 2026-09-24
- 开源 MCP 让 Agent 看懂网页变更:18 个工具附 SHA-256 取证证书 — Einperegrin · 2026-09-24
- LangChain 力挺「可组合 AI」:用 Jev 把智能体循环拆开重装 — hwchase17 · 2026-09-24