判定模型 Jev 实战六种用法:事实核查 24/24 全对,中位延迟仅 0.41 秒
alexisgallagher · x · 2026-09-19
Isaac Flath 把 TypeSafe 新发布的判定模型 Jev 接入了自己的六个真实工作流,并给出博客与视频,附延迟和准确率评测对比。六个用例:
- 脚本事实核查:自制新闻脚本核查集上,与 Gemini 3.5 Flash 同样 24/24 全对,但 Jev 中位响应 0.41 秒 vs Gemini 的 1.68 秒;还抓住了「半小时电话」实为电话准备时间的措辞错误
- 信息流排序:替代 Gemini Flash 做 LLM-as-a-judge,过滤并排序自己的多源新闻聚合流
- 在 PDF 中定位正确文本
- 引文核查
- 审阅笔记聚类分组
- 诊断 agent 失败原因
核心卖点是用亚秒级延迟的专用判定模型替代又慢又贵的大模型做 judge 类任务,每个场景都给了与原方案的数据对比,可直接照抄到自己的工作流。
「编程与Agent」频道最新
- Muse 开放 Connector 平台:开发者接入 API 即可触达 Agent 用户 — jffwng · 2026-09-19
- Jasper 发布 RL 训练搜索 Agent 教程:奖励函数微调全程开源 — simonguozirui · 2026-09-19
- 做 eval 别用合成数据:多塞真实用户怪案例才有效 — cephaloform · 2026-09-19
- Jev 4.5 分钟完成 SEO 全站审计:爬取、索引、找出 500+ 优化点 — morganb · 2026-09-19
- AWS 研究员展望代码评审未来:LLM + 自动化推理 + 构造正确性 — alexisgallagher · 2026-09-19
- Thorsten Ball 演示 agent 从 shell 历史中挑选下一条命令 — IanArawjo · 2026-09-19