1565 封企业邮件实测:Jev 分类不敌 Gemini 仍被看好上生产
socialwithaayan · x · 2026-09-20
开发者 nikhilmudholkar 用来自工业供应商的 1565 封德语和英语商务邮件、10 个分类目测试了 TypeSafe 的 Jev 模型,结果 Jev 在邮件分类基准上输给了 Gemini。但测试者仍有意将其投入生产环境,因为更有价值的信息不是准确率本身,而是错误发生的具体位置——这决定了它在真实业务里的可用性。该评测被整理进 TypeSafe Jev 走红的 11 个用例汇总帖中。
「编程与Agent」频道最新
- 开发者热议:编排交给模型会更贵,开源多智能体编排器更有成本动力 — soumitrashukla9 · 2026-09-20
- Agent 评测退化解难题:直接写出端到端策略算赢吗 — JoshPurtell · 2026-09-20
- 开源项目 rakazo:本地 Docker 自建常驻 AI bot,自带 Linux 桌面与记忆 — dr_cintas · 2026-09-20
- PumpGTM 创始人拆解 MCP 在销售外联工作流中的安全接入设计 — namanyayg · 2026-09-20
- 工程师自述:从 Codex 转用 Opus 后,工作愤怒感消失 — Nice_Pressure_7390 · 2026-09-20
- Jev 做 PR 审查比 GPT-5.6 Luna 快 1.93 倍,单次仅 $0.0014 — aniketmaurya · 2026-09-20