20美分实测小模型Jev:检索与分类大涨,延迟仅0.2秒
AI 写书公司创始人 Mike Giannulis 于 9 月 18 日发布 12 连贴,完整记录了一次「用小模型替换大模型」的离线验证实验:把 3,300 条真实生产决策通过 @typesafeai 的小模型 Jev 回放,方法是从自家数据库拉取真实输入,与过去的 Claude 决策及人工标注/确定性真值对比,并在看到结果前预设通过/失败规则,全程离线、不做线上实验。
已确认
- 书稿素材检索上,嵌入相似度把正确段落排第一的概率为 60%,加入 Jev 重排后提升到 90%。
- 门户意图路由准确率 90.5%,高于原有关键词路由的 83.8%;「我已经做过这件事」检测 98.3%,高于正则方案的 96.6%,且回放中精确抓到了此前在生产环境漏掉、令团队难堪的那条消息。
- 自家客服支持分类器把 13 条类似「请发短信,别打电话」的消息错归「other」,Jev 在回放中全部抓住。
- 忠实度判别:148 对干净样本上 95% 准确,Brier 分数 0.057;作者同时提醒小规模测试不能证明生产环境的完美校准。
- 失败案例:微妙措辞的作者邮件任务上自家 LLM 约 2:1 胜过 Jev;「太像推销」这类主观判断帮不上忙;数据稀薄的销售线索评分无改进。
- 延迟实测约 0.2 秒对比原来的 2–4 秒;作者承认标题里的「20 美分」是噱头——替换本来就便宜的调用,token 账单几乎不动。
尚未确认
- 上述结果均为离线回放,尚未经过生产环境验证;作者本人也明确克制表态。
为什么重要
作者的核心结论是「在买更聪明的模型之前,先检查是不是让它干了错误的活」:业界排行榜无法反映「请发短信别打电话被归入 other」这类只有自家数据才能暴露的问题,小模型适合的是「无聊但搞砸了客户会立刻察觉」的任务。下一步为重排器、门户路由、「已做过」检测和联系偏好分类上线影子模式,双记录新旧决策、检查分歧,并保留一键 kill switch——离线验证的胜利只换来一次影子模式的机会,而不是整个业务的钥匙。
2026-09-18 ~ 2026-09-18 · 10 条相关
- 第 1 集:Jev 模型直出结构化决策,$0.042/M token 替代文本解析(2026-09-18,2 条)
- 第 2 集:20美分实测小模型Jev:检索与分类大涨,延迟仅0.2秒(2026-09-18,10 条)
一手来源
- 用 3,300 条真实生产决策回放测试小模型 Jev 的真实表现 — mikegiannulis ·
- 买更强模型前先问是不是用错了活:Jev 实测全记录与上线守则 — mikegiannulis ·
- 同素材下 reranking 把正确段落命中率从 60% 提到 90% — mikegiannulis ·
- 花 20 美分测试「不会写句子」的 AI,却补上了分类器漏掉的 13 条请求 — mikegiannulis · 2026-09-18
- 【源头】用 3,300 条真实生产决策回放测试小模型 Jev 的真实表现 — mikegiannulis · 2026-09-18
- 【源头】买更强模型前先问是不是用错了活:Jev 实测全记录与上线守则 — mikegiannulis · 2026-09-18
- 【源头】同素材下 reranking 把正确段落命中率从 60% 提到 90% — mikegiannulis · 2026-09-18
- 「请发短信别打电话」被分进 other:小模型补上客服分类盲区 — mikegiannulis · 2026-09-18
- 意图路由 90.5% 胜关键词路由 83.8%,还抓到线上漏网之鱼 — mikegiannulis · 2026-09-18
- 忠实度判别 148 对测试 95% 准确,Brier 0.057 但作者保持克制 — mikegiannulis · 2026-09-18
- 失败清单:微妙作者邮件大模型 2:1 胜出,三类任务小模型无用 — mikegiannulis · 2026-09-18
- 20 美分账单是噱头,真正收益是 0.2 秒对 2–4 秒的延迟 — mikegiannulis · 2026-09-18
- 离线赢一回只配拿影子模式,拿不到整个业务的钥匙 — mikegiannulis · 2026-09-18