前苹果工程师开源 jevals:本地一拍即合的 Agent 评测利器
byebaybay · reddit · 2026-09-22
作者曾在 Apple 用 BERT 分类器大幅改进 NLP 分类系统,深知持续微调、防漂移的维护之苦,于是开源了 jevals——用 Jev 式「一拍决策模型」做本地 Agent 评测。
核心卖点有三:
- 成本与延迟:LLM-as-a-judge 在百万级决策下又贵又慢(作者曾试图用 OpenAI 并行化加速 Ragas 仍遇瓶颈),而分类器本地跑几乎零成本,agent 循环内尤其实用;
- 泛化:可用自然语言提问适配分类器,免去每个任务一次微调工程;
- 选对工具:答案只是标签/概率/分数的问题,本就不该用文本生成来解决。
jevals 把 agent 检查变成带类型的问题定义,同一套 eval 既可用于离线 trace,也能作为运行时 guardrail。项目开源于 GitHub(openlayer-ai/jevals)。
「编程与Agent」频道最新
- Cursor 面试新玩法:候选人人手一个 Composer 1 模型限时造项目 — steipete · 2026-09-22
- theo 吐槽 200 美元/月编码订阅:当年说好「几乎不限量」呢 — haydendevs · 2026-09-22
- 开发者用 Copilot+Luna 全自动补全 issue,16.6 美分跑通全流程 — lee_stott · 2026-09-22
- 把 AI 报告 agent 砍到只做填表,才真正省下时间 — Big_Currency_1805 · 2026-09-22
- 警惕 slop 龙卷风:读推理轨迹、盯紧你的 Agent — deobfuscations · 2026-09-22
- 本地 Qwen 27B Agent 接管亚马逊账号,一次跑通自动买纸 — fuzhongkai · 2026-09-22