Braintrust 集成 Jev: typed 决策模型可替代 LLM-as-a-judge
multiply_matrix · x · 2026-09-19
- Braintrust 宣布支持把 TypeSafe 的 Jev 用作 judge scorer 来评估 agent 响应。
- Jev 处理对非结构化数据的窄类型决策:代码提供状态与带约束答案类型的问题,并行评估后直接返回答案、概率与置信度,无需解析生成文本。示例:客服请求「被重复扣费」,Jev 以 100% 置信度归入 billing。
- 可在 Braintrust 中查看 Jev 选中的答案、置信度与概率,并用 JavaScript/Python SDK 从应用侧追踪 Jev 调用,据此迭代评分标准。
- TypeSafe 自报数据:其工作流评测中执行速度最高快 193.6 倍、成本低 444.6 倍。文章还讲解了如何把「是否可发送」等判断拆成分类或打分题。
「编程与Agent」频道最新
- Greg Kamradt:带 AI 的人类仍比 AI 带 AI 更高效 — GregKamradt · 2026-09-19
- 前搜索从业者:Jev 或让 agent 的工具调用路由回归判别式模型 — multiply_matrix · 2026-09-19
- Box CEO 演示用 Jev 做即时文件分类路由,几乎零成本 — multiply_matrix · 2026-09-19
- Walrus Memory 推出可跨应用与模型的 Agent 便携记忆 — udmrzn · 2026-09-19
- 把 Jev 做成 if 语句:实验性编程语言「Probably」亮相 — ritakozlov · 2026-09-19
- Notion 自研 CRDT 协同编辑:每分钟处理数百万次操作 — dejavucoder · 2026-09-19