用 Jev 判断模型做六件事:核查脚本到诊断 Agent 失败
HamelHusain · x · 2026-09-18
Isaac Flath 分享了使用 TypeSafe 新发布的判断模型 Jev 的六类实战场景,并称这些都是他确信 60 天后仍会继续用的用法:
- 核查脚本事实:检查自己写的新闻脚本是否被原文支持,发现「半小时通话」实为通话前的准备时间等错误,24/24 全对,中位响应仅 0.41 秒(Gemini 3.5 Flash 为 1.68 秒)且更便宜;
- 新闻源排序:作为 LLM judge 给聚合的信息流打分排序,低于阈值的隐藏;
- 在 PDF 中定位正确文本;
- 核查引用;
- 归组评审笔记;
- 诊断 Agent 失败:对执行轨迹(traces)做 eval,找出 agent 为什么失败。
整体思路是:先从「小而无聊但有用」的任务做起,用判断模型替代慢且贵的通用模型做评测类工作。
所属事件:实测 TypeSafe 判断模型 Jev:六大场景速度比 Gemini 快 4 倍(2 条相关)→
「编程与Agent」频道最新
- Sim 推出 Sim Search:智能体自动跨上千工具构建知识图谱 — JafarNajafov · 2026-09-18
- Ethan Mollick 用 Claude Projects 3D 复原翁贝托·艾柯的 3.3 万册藏书 — emollick · 2026-09-18
- Cua 团队推 jev-use:号称「快速计算机操作已被解决」 — TianbaoX · 2026-09-18
- 开发者用 Jev 做出会自动翻页的智能幻灯片演示 — threepointone · 2026-09-18
- DeepSeek Harness 推进 v0.1.6 预发布,客户端应用渐成形 — teortaxesTex · 2026-09-18
- 前 ChatGPT 联合发明者发布 Jev:宣称快 200 倍、便宜 400 倍 — iamrobotbear · 2026-09-18