TypeSafe 发布决策模型 Jev:不聊天、直接给答案
TypeSafe(由 ChatGPT/InstructGPT 背后的研究员之一 Diogo Almeida 创办)发布首个模型 Jev,定位不是更好的聊天机器人,而是「决策引擎」:输入应用状态加一组带类型的问题,直接输出选项、分数与概率供代码执行,完全不会生成文本。官方宣称比 LLM 快 20-200 倍、便宜 40-400 倍(输出 token 免费,输入计费约合每百万 token 0.042 美元),延迟 70-500 毫秒,采用新训练方法 RLCD。演示中 Jev 实时游玩了《地铁跑酷》,展示实时决策能力。
已确认
- Jev 采用「System One」思路:不逐 token 生成文本,而是从固定候选答案中直接选出决策并给出置信度,与 LLM 的「System Two」逐 token 生成相对。
- 延迟 70-500ms,输出 token 免费,定位为混合分类器与 LLM 之外的第三条路线。
- 独立 AI 工程师 @mostlyidempotent 的早期体验确认其返回结构化决策而非文本,延迟约 70ms。
- @mikegiannulis 做了离线回放测试(真实历史输入 + 人工标注真值,事前预设通过/失败规则):书稿素材 reranking 中,嵌入相似度把正确段落排第一的概率为 60%,Jev 提升到 90%;门户意图路由 90.5% 对原关键词路由 83.8%;「我已经做过这件事」检测 98.3% 对正则方案 96.6%;148 对忠实/捏造样本上 95% 准确、Brier 0.057;回放中还抓到此前生产环境漏判、令团队难堪的客服消息(如「请发短信别打电话」被旧分类器归入 other)。
尚未确认
- 「快 20-200 倍、便宜 40-400 倍」均为官方宣称,独立基准尚不充分;发布者身份也有传播噪音——多数转帖称「ChatGPT 联合发明者」,而 @adrianscottcom 指明 Diogo Almeida 是 InstructGPT 共同作者,具体署名口径不一。
- 小规模回放不能证明生产环境的完美校准,@mikegiannulis 自己也明确保持克制。
为什么重要
- Jev 代表「小模型补位」范式:不是替代 LLM,而是在确定性的 yes/no、路由、分类等任务上用概率化输出取代「让 LLM 写一段话再挖答案」的迂回做法。
- @mikegiannulis 同时披露失败清单:微妙措辞的作者邮件上自家 LLM 约 2:1 胜出,「太像推销」类主观判断帮不上忙,数据稀薄的销售线索评分无改进——这类盲区在 AI 排行榜上找不到,只有回放自家数据才能暴露,也为该模型的适用边界提供了少见的诚实参照。
2026-09-17 ~ 2026-09-18 · 44 条相关
- 第 1 集:TypeSafe 结束隐身发布决策模型 Jev 与新训练法 RLCD(2026-09-16,86 条)
- 第 2 集:TypeSafe AI 发布专用评估模型 Jev,实测速度与成本优势显著(2026-09-16,8 条)
- 第 3 集:Vercel fx 安全审查将换用 Jev 快 18 倍(2026-09-17,3 条)
- 第 4 集:TypesafeAI 零样本分类器 Jev 上线 AI Gateway(2026-09-17,2 条)
- 第 5 集:TypeSafe 发布决策模型 Jev:不聊天、直接给答案(2026-09-17,44 条)
- 第 6 集:TypeSafe AI 评估模型 Jev 上线 Vercel 与 Cloudflare 网关(2026-09-17,4 条)
- 第 7 集:Typesafe AI 发布高速分类模型 Jev 实测便宜五倍(2026-09-17,2 条)
- 第 8 集:实测 Jev 推文分类:比最快 LLM 快 6 倍、便宜 40 倍(2026-09-17,2 条)
- 第 9 集:Jev 模型直出结构化决策,$0.042/M token 替代文本解析(2026-09-18,2 条)
一手来源
- TypeSafe Jev 返回结构化决策而非文本:输出免费、延迟仅 70ms — mostly_idempotent ·
- ChatGPT 研究员创办 TypeSafe,首发模型 Jev 只做决策不写字 — Scobleizer ·
- 同素材下 reranking 把正确段落命中率从 60% 提到 90% — mikegiannulis ·
- Jev 引发热议:很多人忘了 encoder-only 分类器早已存在且好用 — brandon_galang · 2026-09-17
- Jev 走红背后:许多人不知道 encoder-only 分类器早已成熟 — RichmanRonald · 2026-09-17
- 实测 TypeSafe 判断模型 Jev:六大场景,速度比 Gemini 快 4 倍 — HamelHusain · 2026-09-18
- 用 Jev 判断模型做六件事:核查脚本到诊断 Agent 失败 — HamelHusain · 2026-09-18
- 前 ChatGPT 联合发明者发布 Jev:宣称快 200 倍、便宜 400 倍 — iamrobotbear · 2026-09-18
- 开源分类器模型 Jev 走红背后:很多 AI 开发者连分类器都写不出来 — edgarpavlovsky · 2026-09-18
- 【源头】ChatGPT 研究员创办 TypeSafe,首发模型 Jev 只做决策不写字 — Scobleizer · 2026-09-18
- 前ChatGPT共同作者隐身两年推出Jev模型,检测API宣称便宜百倍 — gaganghotra_ · 2026-09-18
- 放弃自回归的 Jev 模型:只输出结构化决策的另类路线 — karminski3 · 2026-09-18
- 非自回归决策模型 Jev:70ms 出结构化决策,输入仅 $0.042/百万 token — karminski3 · 2026-09-18
- 非聊天模型 Jev 主打 70-500ms 概率判断,输出免费每百万 token 仅 0.042 美元 — adrianscottcom · 2026-09-18
- Jev 模型详解:不写文本、单次前向输出结构化决策的新范式 — blaizedsouza · 2026-09-18
- 开发者点评 Jev:大量分类任务不该硬塞给 LLM,浏览器端可廉价运行 — GabGarrett · 2026-09-18
- TypeSafe 发布 System One 模型 Jev:100ms 出带概率的判断型小模型 — aronchick · 2026-09-18
- ChatGPT 联合创始人团队新决策模型 Jev 实时玩《地铁跑酷》 — Cagnazzo82 · 2026-09-18
- ThursdAI 播客聚焦 Jev 实时模型与计算机使用智能体三大主题 — altryne · 2026-09-18
- ThursdAI 周报:非 LLM 决策模型 Jev 被称 ChatGPT 时刻,Dario 提三条放缓方案 — altryne · 2026-09-18
- 实测 Jev 一天:它更像低延迟决策器,Computer Use 是最佳场景 — jiayuan_jy · 2026-09-18
- 实测 Jev 一天后:一个快得离谱的分类器,不是 GPT 替代品 — jiayuan_jy · 2026-09-18
- ChatGPT 联合作者推出决策模型 Jev:快 20-200 倍、便宜 40-400 倍 — thisiskp_ · 2026-09-18
- 【源头】TypeSafe Jev 返回结构化决策而非文本:输出免费、延迟仅 70ms — mostly_idempotent · 2026-09-18
- 花 20 美分测试「不会写句子」的 AI,却补上了分类器漏掉的 13 条请求 — mikegiannulis · 2026-09-18
- 用 3,300 条真实生产决策回放测试小模型 Jev 的真实表现 — mikegiannulis · 2026-09-18
- 买更强模型前先问是不是用错了活:Jev 实测全记录与上线守则 — mikegiannulis · 2026-09-18
- 【源头】同素材下 reranking 把正确段落命中率从 60% 提到 90% — mikegiannulis · 2026-09-18
- 「请发短信别打电话」被分进 other:小模型补上客服分类盲区 — mikegiannulis · 2026-09-18
- 意图路由 90.5% 胜关键词路由 83.8%,还抓到线上漏网之鱼 — mikegiannulis · 2026-09-18
- 忠实度判别 148 对测试 95% 准确,Brier 0.057 但作者保持克制 — mikegiannulis · 2026-09-18
- 失败清单:微妙作者邮件大模型 2:1 胜出,三类任务小模型无用 — mikegiannulis · 2026-09-18
- 20 美分账单是噱头,真正收益是 0.2 秒对 2–4 秒的延迟 — mikegiannulis · 2026-09-18
- 离线赢一回只配拿影子模式,拿不到整个业务的钥匙 — mikegiannulis · 2026-09-18
- 只做决策不生成文本:Jev 比 gpt-4o-mini 快 2.4 倍、便宜 3.4 倍 — Al_Grigor · 2026-09-18
- 非 LLM 模型 Jev 亮相:不写答案,直接返回概率 — thursdai_pod · 2026-09-18
- 计算机使用 Agent 实测:23 款助手 273 项测试,Muse 已能打电话理发 — thursdai_pod · 2026-09-18
- ThursdAI 周报:TypeSafe 发布 Jev 决策模型,延迟 70-500ms 且输出免费 — thursdai_pod · 2026-09-18
另有 9 条近重复转述:threepointone · hardimanjames · HankYeomans · multiply_matrix · multiply_matrix · multiply_matrix · GabGarrett · multiply_matrix · hardimanjames