.025 · AGI Hunt

开发者实测 Jev:50 份发票全对,每次决策仅 $0.025

PawelHuryn · x · 2026-09-19

一位开发者对 Jev(文本分类模型)做了独立基准测试。Jev 上线三天,基于它的项目从 46 个涨到 160 个,作者决定用数据验证其宣传。

测试设计:50 份发票文档、6 种类型、10 种语言,其中 32 份带有误导性线索(如名为 PROFORMA 的真实发票、明确声明不是付款请求的 INVOICE SUMMARY),还有 OCR 错误、大写金额、无关键词的邮件式发票。

结果(正确数 / 每 1000 次决策成本):

对比可本地运行的 Ministral 8B,Jev 便宜约 20%,单次慢约 90ms,但批量模式下 32 个问题耗时约等于 1 个。宣传中的「便宜 444 倍」是与更贵模型对比的结果。

关键发现:

结论:生产化发票分类需要三点——记录每次输入/决策/置信度、设置人工复核阈值、建立人类纠错的反馈闭环(如带重训练管线的专用分类器)。业务规则必须随每次请求提供,纠正不会自动跨调用保留。

所属事件:开发者实测 Jev 分类模型:50 份发票全对、成本约为 Claude Opus 百分之一(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →