开发者实测 Jev 分类器:50 单据全对且最便宜,但缺规则时自信犯错
PawelHuryn · x · 2026-09-19
一位开发者对分类模型 Jev 做了独立实测,给「444× 便宜」的官方宣传补上数据支撑与边界。
发票分拣测试
- 自建 50 份、6 类、10 语言含 OCR 错误和误导线索的难数据集,每千次决策成本:
- Jev: 50/50 全对,$0.025
- GPT-OSS 20B: 48/50,$0.030
- Ministral 8B: 48/50,$0.031
- Claude Haiku 4.5: 50/50,$0.39
- Gemini 3.8 Flash: 49/50,$1.03
- Claude Opus 5: 49/50,$2.83
- 与可本地运行的 Ministral 8B 相比,Jev 只便宜约 20%、单次慢约 90ms,但批量模式下 32 题几乎与 1 题同速。
置信度边界
- 只给类名不给定义:46/49 对,所有错误置信度都低于 0.80,以 0.80 为阈值可全部拦截。
- 但在 24 条含隐性客服规则的消息测试中,规则写进 prompt 是 24/24 全对,不写只有 5/24——19 个错误里 15 个置信度高于 0.90,即「自信但错」。
- 用标注样例代替规则效果也差:Jev 13/24,Ministral 8B 18/24。
结论:业务规则必须随每次请求显式提供,不会自动跨调用保留;置信度阈值能兜住分类错误,兜不住缺失规则导致的错误。生产上需要记录每次决策与置信度、设人审阈值、并建立人工纠错反馈回路。规则用自然语言描述、需要当天上线时,Jev 是最低成本达到最高准确率的选择。
所属事件:开发者实测 Jev 分类模型:50 单全对,成本极低(4 条相关)→
「编程与Agent」频道最新
- Jev 结构化输出模型爆红,Yegge 主张用围栏取代沙箱管 Agent — njyx · 2026-09-19
- 临时邮箱 MCP 服务器上线:让 AI Agent 自动收验证码零人工 — modelcontextprotocol · 2026-09-19
- 用 GPT-6 Astra 经 MCP 驱动 Blender 建模 3D 打印,作者分享实战与省钱方案 — Julianw20012 · 2026-09-19
- 2 美元蓝牙自拍器改造为编程 Agent 的物理 Push-to-Talk 按钮 — _7xen_on · 2026-09-19
- 哪些事你绝不交给 AI agent?多数人画线在替我发言 — Luvena21 · 2026-09-19
- willcb:上下文学习要胜任个人持续学习,得靠「怪异」神经符号 harness — willcb · 2026-09-19