Jev 实测:固定标签分类任务准确率持平现有模型,成本低约百倍
ivan_bezdomny · x · 2026-09-19
开发者 drewdil 用一天时间把 Typesafe AI 的 Jev 与自家生产环境的判别模型做了基准对比,结论是在「从固定列表选标签」这类任务上,Jev 能以极低成本打平甚至超过现有模型。
实测数据:
- 销售通话转写分类(32 类固定标签):合成集含 20 个对抗样例,Jev 35/36 正确,现有小模型分类器为 34/36;三次重复运行零标签漂移,单次调用成本约低 100 倍。
- 知识图谱节点关系打标(固定词表):在 47 例金标语料上通过全部四个硬性质量门(仅比生产模型差一例),成本约低 65 倍、延迟约低 15 倍。
- Slack 频道四分类:留存集 16/16 全对。
适用形状总结:标签列表由你定义、证据就在输入里的分类任务——Jev 擅长;需要推理或递归式生成的工作则不是它的强项。
「模型」频道最新
- Meta Muse + Jev 十秒级筛出免疫学百大未解问题 — DeryaTR_ · 2026-09-19
- Braintrust 集成 Jev: typed 决策模型可替代 LLM-as-a-judge — multiply_matrix · 2026-09-19
- GPU 涨价殃及 1080ti,本地模型推理速度实测清单流出 — HankYeomans · 2026-09-19
- 实测 24 小时烧 $3.40:Jev 会与 LLM 融合而非取代 — gaganghotra_ · 2026-09-19
- 仅凭录屏参考,GPT-6 Astra 两轮迭代做出火焰喷射器 demo — techartist_ · 2026-09-19
- Databricks:企业工程师转向开源模型,20% 流量迁移即大省成本 — Yuchenj_UW · 2026-09-19