开源项目 jevals:用 JEV 式决策模型在本地跑 agent 评估

byebaybay · reddit · 2026-09-24

开发者发布了开源项目 jevals,主张用 JEV 风格的决策模型(本质是一次性分类器)替代昂贵的 LLM-as-a-judge 来做 agent 评估。核心论点:

项目已开源,作者征集在真实数据上的反馈。

所属事件:前苹果工程师开源 Agent 评测工具 jevals(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →