开发者实测 Jev:50 份发票全对,每次决策仅 $0.025
PawelHuryn · x · 2026-09-19
一位开发者对 Jev(文本分类模型)做了独立基准测试。Jev 上线三天,基于它的项目从 46 个涨到 160 个,作者决定用数据验证其宣传。
测试设计:50 份发票文档、6 种类型、10 种语言,其中 32 份带有误导性线索(如名为 PROFORMA 的真实发票、明确声明不是付款请求的 INVOICE SUMMARY),还有 OCR 错误、大写金额、无关键词的邮件式发票。
结果(正确数 / 每 1000 次决策成本):
- Jev:50/50,$0.025
- GPT-OSS 20B:48/50,$0.030
- Ministral 8B:48/50,$0.031
- Claude Haiku 4.5:50/50,$0.39
- Gemini Flash:49/50,$1.03
- Claude Opus:49/50,$2.83
对比可本地运行的 Ministral 8B,Jev 便宜约 20%,单次慢约 90ms,但批量模式下 32 个问题耗时约等于 1 个。宣传中的「便宜 444 倍」是与更贵模型对比的结果。
关键发现:
- 移除类别定义后 Jev 仍得 46/49,错误均在 0.80 置信度以下,正确答案平均 0.97——置信度阈值能有效拦截发票错误
- 但加入与直觉矛盾的业务规则(如重复扣费应转支持而非账单)时:规则写在提示里 24/24 全对,不写只有 5/24,且 19 个错误中 15 个置信度高于 0.90——「确定且错误」,置信度无法捕捉缺规则导致的错误
- 用标注样本替代规则更差:Jev 13/24,Ministral 8B 18/24
结论:生产化发票分类需要三点——记录每次输入/决策/置信度、设置人工复核阈值、建立人类纠错的反馈闭环(如带重训练管线的专用分类器)。业务规则必须随每次请求提供,纠正不会自动跨调用保留。
所属事件:开发者实测 Jev 分类模型:50 份发票全对、成本约为 Claude Opus 百分之一(3 条相关)→
「编程与Agent」频道最新
- 开发者实测:Codex 值 200 美元档,Claude 100 美元够用 — lxfater · 2026-09-19
- AgentSky 上线:浏览器免装调用 40+ 编码 Agent 可横向比价 — Aiden_Tech_Ai · 2026-09-19
- qwen-code SDK v0.1.13 发布:微压缩修复保住长会话提示词缓存 — github-actions[bot] · 2026-09-19
- 从脚本到推理模型:决策类任务正被拆出第三层架构 — arpit_bhayani · 2026-09-19
- Lovable 内部沙箱从 Vite 迁移至 Rust 方案 OJ — w_hgm · 2026-09-19
- 免密钥免费文本分类 API 上线,自称准确率超 Jev — altryne · 2026-09-19