20美分实测小模型Jev:检索与分类大涨,延迟仅0.2秒

AI 写书公司创始人 Mike Giannulis 于 9 月 18 日发布 12 连贴,完整记录了一次「用小模型替换大模型」的离线验证实验:把 3,300 条真实生产决策通过 @typesafeai 的小模型 Jev 回放,方法是从自家数据库拉取真实输入,与过去的 Claude 决策及人工标注/确定性真值对比,并在看到结果前预设通过/失败规则,全程离线、不做线上实验。

已确认

尚未确认

为什么重要

作者的核心结论是「在买更聪明的模型之前,先检查是不是让它干了错误的活」:业界排行榜无法反映「请发短信别打电话被归入 other」这类只有自家数据才能暴露的问题,小模型适合的是「无聊但搞砸了客户会立刻察觉」的任务。下一步为重排器、门户路由、「已做过」检测和联系偏好分类上线影子模式,双记录新旧决策、检查分歧,并保留一键 kill switch——离线验证的胜利只换来一次影子模式的机会,而不是整个业务的钥匙。

2026-09-18 ~ 2026-09-18 · 10 条相关

事件全程(共 2 集)→

一手来源