前苹果工程师开源 Agent 评测工具 jevals
一位前苹果工程师开源了 Agent 评测工具 jevals,其设计初衷是解决 LLM-as-a-judge 在成本与延迟上的瓶颈。作者曾在苹果用 BERT 分类器改进 NLP 分类系统,深知持续微调与防漂移的维护之苦,因此采用「一拍决策模型」实现本地、快速的 Agent 评测,无需调用昂贵的 LLM,为开发者提供了轻量级替代方案。
2026-09-22 ~ 2026-09-22 · 1 条相关
- 前苹果工程师开源 jevals:本地一拍即合的 Agent 评测利器 — byebaybay · 2026-09-22