实测 Jev 发票分类:50/50 全对,成本仅 Claude Opus 约 1/110
PawelHuryn · x · 2026-09-19
开发者在 Jev 相关项目三天从 46 个涨到 160 个的背景下,亲手复测了厂商展示的发票分类任务,用 50 份、6 类、跨 10 种语言、带 OCR 错误和误导性线索(如标着 PROFORMA 却已发货的账单)的困难数据集对比 6 个模型:
- 成绩与成本(正确数/50,每千次决策成本):Jev 50 对 / $0.025;GPT-OSS 20B 48 / $0.030;Ministral 8B 48 / $0.031;Claude Haiku 4.5 50 / $0.39;Gemini Flash 49 / $1.03;Claude Opus 5 49 / $2.83。
- 宣传中的「444× 便宜」是与高价模型对比的结果;Jev 对比可本地部署的 Ministral 8B 只便宜约 20%,单次慢约 90ms,但批量模式下 32 题耗时约等于 1 题。基线选择和请求模式比头条倍数更重要。
- 置信度筛选有效:去掉定义只留类名,Jev 46/49 对,所有错误置信度低于 0.80,正确答案平均 0.97,0.80 阈值在本数据集上可拦下全部错误。
- 但置信度有盲区:24 条含隐性业务规则的客服消息,规则写进 prompt 时 24/24 全对,不写则仅 5/24,且 19 个错误中 15 个置信度超过 0.90——「确定且错误」。规则必须随请求提供,用标注样本替代规则效果更差(Jev 13/24,Ministral 8B 18/24)。
- 落地建议:记录每次输入/决策/置信度、设人工复核阈值、建立人工纠错反馈闭环。
所属事件:开发者实测 Jev 分类模型:50 份发票全对、成本约为 Claude Opus 百分之一(3 条相关)→
「模型」频道最新
- Codex 额度重置恢复,用户称此前几天额度全面耗尽 — CtrlAltDwayne · 2026-09-19
- 传 Anthropic Opus 5.2 纯 JS+three.js 生成 5 分钟泰坦尼克电影 — dotey · 2026-09-19
- 重启会话后模型仍记得 cranberry-42:持久记忆测试趣闻 — RileyRalmuto · 2026-09-19
- 免费模型更笨?反驳帖引论文称 SOTA 模型仍难消除幻觉 — AryHHAry · 2026-09-19
- 为什么 AI 个性同质化?安全训练与依恋恐惧是主因 — alexisgallagher · 2026-09-19
- 新模型 JEV 部分平台免费用,输入 token 低至约 $0.042/百万 — airesearch12 · 2026-09-19