30 分之一成本达到 99.5% 一致:两个「jev」小模型实战用例
multiply_matrix · x · 2026-09-20
Detail 团队分享了他们头两个用廉价小模型(社区称 jev)替代昂贵 LLM 调用的生产用例:
- PR 评论意图判断:当有人评论 PR 时,用 LLM 判断评论是在提要求(如「删掉这个测试」)还是单纯闲聊(如「这看起来对吗?」);被识别为请求时以 👀 表情确认收到。响应时间从 1200ms 降到 400ms。
- 重复 bug 检测:发现新 bug 时判断是否与已上报 bug 重复——难点是无关代码改动会把「同一个」bug 移到新位置(不该重复报),而结构几乎相同、位置不同的 bug(如两条路由都有同样的鉴权缺失)又要分开报。这也改用 jev 检查。
两个场景的回测均显示与贵 30 倍的模型约 99.5% 的一致率。
「编程与Agent」频道最新
- LangChain 推出 Jev 评测器:打分方差低 92-913 倍,成本仅 0.34 美元 — LangChain · 2026-09-20
- 自然语言逻辑解释器开源:Jev 负责统一,Claude 做前置转换 — narphorium · 2026-09-20
- 开发者将 Jev 接入 Codex 加速浏览器操作,数百次试验仅花 $0.007 — TheZachMueller · 2026-09-20
- CUA Agent 数据集要连任务一起伪标注,因为网站常变任务会过期 — mervenoyann · 2026-09-20
- Pi 编码工具发布 0.86.0:支持会话中系统消息与动态工具 — mitsuhiko · 2026-09-20
- 开发者把今年做的抖动着色器全搬进 Leafalia,跑通了 — eschadiol · 2026-09-20