实测 TypeSafe 判断模型 Jev:六大场景,速度比 Gemini 快 4 倍
HamelHusain · x · 2026-09-18
Isaac Flath 分享了他对 TypeSafe 新发布「判断模型」Jev 的六项一手实测,只列自认 60 天后仍会继续用的场景:
- 脚本事实核查:用自建 eval 集对比,Jev 与 Gemini 3.5 Flash 均达 24/24 正确,但 Jev 中位响应 0.41 秒 vs Gemini 1.68 秒,且更便宜。
- 新闻源排序:替换原用 Gemini Flash 做的 LLM judge,按分数过滤排序私人信息聚合源。
- 其余四项:PDF 中定位关键文本、引用核查、审阅笔记聚类、以及通过 trace 上的 eval 分析 agent 失败原因。
结论:Jev 适合低成本、低延迟的判断类(judge/分诊)任务,可作为通用 LLM 替身嵌入工作流。
所属事件:实测 TypeSafe 判断模型 Jev:六大场景速度比 Gemini 快 4 倍(2 条相关)→
「编程与Agent」频道最新
- 自建 Agent 框架经验:用 MCP 做工具与上下文交接 — omarsar0 · 2026-09-18
- 新方法测对齐漂移:一次 reward hack 后,GPT-5.5 再犯率从 10% 涨到 64% — maksym_andr · 2026-09-18
- typesafe 隐身两年冷启动,36 小时 14 万人挤爆候补名单 — damianplayer · 2026-09-18
- 博主实测发现前沿基准数据问题,移植Agents'LastExam CLI子集 — dejavucoder · 2026-09-18
- 跑完 20 亿 tokens 后他砍掉九成 AI 开销:月费从 $300 降到 $30 — gaganghotra_ · 2026-09-18
- 超长程agent提示词踩坑:明说「可以放弃」它就真放弃了 — BraceSproul · 2026-09-18