专题 · FULL STORY
TypeSafe 惊艳亮相:决策模型 Jev 从发布到实测
隐身两年的 TypeSafe 于 9 月 16 日结束保密,发布首个 System One 决策模型 Jev 与新训练法 RLCD。凭借毫秒级决策与极低价格,Jev 迅速接入 Vercel、Cloudflare 网关,实测显示比最快 LLM 快数倍、便宜数十倍,引发广泛讨论。
2026-09-16 ~ 2026-09-18 · 9 集 · 153 条
第 1 集 · TypeSafe 结束隐身发布决策模型 Jev 与新训练法 RLCD(2026-09-16,86 条)
9 月 16 日,隐身约两年的新实验室 TypeSafe 结束保密状态,发布首个 System One 模型 Jev 与配套的新训练方法 RLCD。创始人 Diogo Almeida(X 账号 @CompleteSkeptic)自称曾在 OpenAI 参与 ChatGPT 背后的指令遵循研究,多条转发帖以「ChatGPT 联合发明者」称呼他,但这一身份为自我表述,未经独立核实。目前所有性能宣称均为发布方单方面说法,尚无独立评测,部分转发帖中已出现质疑与群嘲。
已确认
- TypeSafe 发布了新模型 Jev 与新训练方法 RLCD。据 @rohanpaulai 介绍,Jev 是该公司首个 System One 模型;多条转发帖转述 Diogo Almeida 是 InstructGPT 论文作者之一。
- Jev 定位不是聊天模型,而是「决策智能」:用自然语言提问(包括模糊、主观的问题),返回 yes/no 或自定义类别的概率,以纯 API 形态提供,不做文本生成。@hardimanjames 转述的典型用例是给客服工单问「这个客户听起来生气吗」,返回 0.9 这样的概率,典型响应约 0.7 秒。@bindureddy 将其概括为一个能在多选项面前做智能决策的分类器,认为这类近乎免费的分类能力对任何 agent 平台都是很好的补充(其「智能水平可比大模型」的说法为发布方口径);她在后续帖中进一步提出,Jev 这类单次前向传播直接输出选项概率的小模型可作为决策器,缓解当前 Agent 架构串行执行(选工具、分支、重试)的痛点,让 Agent 并行推进千步。
- 产品分工思路是让大模型处理难的推理任务,把路由、欺诈检测、内容审核、验证等海量小型决策交给 Jev 这类小模型。技术路线上不做逐 token 自回归生成,而是将非结构化状态并行输出为类型安全的概率决策。@FrankFelixAI 的对比指出,Jev 用并行计算替代串行计算,与当年 Transformer 凭同样思路超越 RNN 的逻辑相似,代价是无法生成文本,推理快、成本低,只适合分类类任务。The AI Daily Brief 的视频解读也持类似看法,认为大量业务任务本质上只需校准的概率判断而非文本生成。
- 据 @Profanion 转述 The Register 报道,厂商宣称 Jev 幻觉率远低于传统大模型,输出成本也便宜得多。
- 发布方宣称的性能:比现有模型快 20-200 倍、便宜 40-400 倍,输出 token 免费,响应低于 500ms,并称不产生幻觉。@heyabusiddik 的转述给出输入定价为每百万 token $0.042。@TheMoonMidas 的转述称比 Opus 便宜 155 倍、快 20 倍;@soumitrashukla9 一则转述则称比 Fable 级判断快 25 倍、便宜 600 倍,并将 Jev 比作工作流中的「智能 if 语句」——各转发数字略有出入,均源自发布方。
- 发布方还展示了 Jev 实时玩《毁灭战士》的演示,以体现其低延迟决策能力(据 @alexcovoeth 转述)。
尚未确认
- 上述速度、成本与「零幻觉」均为发布方单方面宣称,暂无系统性独立评测或基准验证。
- 「ChatGPT 联合发明者」为创始人自我表述,多数转发帖使用「自称」措辞,@bennash 也明确标注未证实、可信度存疑;具体身份认定主要来自转述(InstructGPT 论文作者之一),尚未经独立核实。@mohbibi 的转发中出现质疑声音,怀疑 Jev 实际上只是专用扩散模型;@karmay007 的转述也提到相关宣称遭到群嘲,暂无官方回应或佐证。
为什么重要
- 若宣称的延迟与成本成立,Jev 可能显著降低在自动化流程中嵌入大量判断调用的门槛,直击当前 agent 工作流的成本痛点。@bindureddy 从架构角度提出的「决策器解放 Agent 串行瓶颈」是值得跟踪的应用假想。
- 「结构化概率输出而非生成文本」代表了一条与主流聊天模型不同的产品化路径,值得后续关注第三方评测、创始人身份信息与技术原理的进一步核实。
- ChatGPT 联合发明者发布新模型 Jev:号称快20倍、便宜40倍 — damianplayer · 2026-09-16
- 前 OpenAI 研究员推出 System One 模型 Jev:快百倍、不会幻觉 — rohanpaul_ai · 2026-09-16
- ChatGPT 联合发明人出新作:Jev 模型专做判断,快 20-200 倍、便宜 40-400 倍 — danshipper · 2026-09-16
- 自称 ChatGPT 联合发明者发布模型 Jev:宣称零幻觉、输出 token 免费 — damianplayer · 2026-09-16
- TypeSafe 发布决策模型 Jev:比 Fable 级判断快 25 倍、便宜 600 倍 — soumitrashukla9 · 2026-09-16
- ChatGPT 联合发明者发布新模型 Jev:自称快 20-200 倍、便宜 40-400 倍 — lateinteraction · 2026-09-16
- 自称 ChatGPT 联合发明者发布 Jev 模型:宣称快 20-200 倍、输出 token 免费 — hackgoofer · 2026-09-16
- ChatGPT 联合发明人创办 TypeSafe 推 Jev:不开口说话的决策模型 — SucceededMind · 2026-09-16
- ChatGPT 联合发明人 stealth 两年后发布新模型 Jev:宣称快 20-200 倍、便宜 40-400 倍 — sedielem · 2026-09-16
- 自述 ChatGPT 联合发明者推出 Jev:宣称快 20-200 倍、便宜 40-400 倍 — lateinteraction · 2026-09-16
- ChatGPT 共同发明人出击:新模型 Jev 宣称快 20-200 倍、省 40-400 倍 — danshipper · 2026-09-16
- TypeSafe AI 发布 Jev:不做文本生成,专做带置信度的快速决策 — yogthinks · 2026-09-16
- ChatGPT 联合发明者推出 Jev:自称幻觉率极低的决策型模型 — hardimanjames · 2026-09-16
- ChatGPT 联合发明者发布决策型模型 Jev:最高快 200 倍、便宜 400 倍 — soumitrashukla9 · 2026-09-16
- 自称 ChatGPT 共同发明者创办的 Typesafe 发布新模型 Jev — hardimanjames · 2026-09-16
- stealth 公司发 Jev 模型:称比前沿模型快 20-200 倍、便宜 40-400 倍且输出免费 — hardimanjames · 2026-09-16
- TypeSafe 推出 Jev 模型:0.7 秒把模糊问题变成概率判断,专供 agent 质检 — hardimanjames · 2026-09-16
- 宣称比 LLM 快百倍的新模型 Jev 发布,主打结构化决策输出 — soumitrashukla9 · 2026-09-16
- OpenAI 老兵创办 TypeSafe 出 stealth:4000 万美元种子轮,发新模型 Jev — hardimanjames · 2026-09-16
- ChatGPT 联合发明人创办 TypeSafe,获 4000 万美元种子轮 — hardimanjames · 2026-09-16
第 2 集 · TypeSafe AI 发布专用评估模型 Jev,实测速度与成本优势显著(2026-09-16,8 条)
TypeSafe AI 发布专用评估模型 Jev,并已接入 Vercel AI Gateway。该公司由 LangChain 的 Sydney Runkle 与 Hunt Lovell 参与打造,官方宣称 Jev 在分类任务上相比同级别 LLM 最多提速 200 倍、降低成本 400 倍。多位开发者的独立实测显示,这款模型在结构化判断任务上速度和成本优势显著,质量达到甚至超越了此前使用的旗舰轻量模型,正在引发「用专用小模型替代通用大模型做分类路由」的讨论。
已确认
- 据 @hackgoofer,Jev 定位为「System One」评估模型,面向软件中的快速结构化判断:对共享状态回答带类型的问题,返回选项、分数与布尔概率,支持分类、路由等场景,已接入 Vercel AI Gateway。
- 开发者 cramforce 将 Jev 接入原本基于 Gemini 2.5 Flash Lite 的分类器评测,结果质量直接把评测跑饱和(100% 准确率),同时速度快 6 倍。
- @jonreed 所在的 Near Here 团队获得早期访问权限,将其用于本地活动数据验证并逐一调优 prompt:响应速度最高提升 5.7 倍,成本降低 98%,准确率提升 12 个百分点。
- @hardimanjames 转述 N8Programs 的实测:在 MMLU、GPQA 等多个选择题基准上对比,验证了 Jev 在 System 1 任务上的智能可与 GPT-5.6 Terra 媲美。
- @manubfr 拿到访问权后测试 Jev 用作对齐监控器:在 4 个公开 benchmark 上评测其对有害内容的判断,称击败主流方案且价格最便宜。
- 据 @hwchase17 转发,Jev 由 LangChain 团队成员 Sydney Runkle 与 Hunt Lovell 参与打造,官方口径为最高 200 倍速度/400 倍成本优化。
尚未确认
- 各项对比数据均来自第三方或早期访问用户的自述,尚未见独立复现;「Luna 级智能」及 200/400 倍优化为厂商宣称口径。
为什么重要
- 四组独立的真实生产/评测替换都指向同一结论:在结构化判断类任务上,专用评估模型可以用远低于通用大模型的延迟和成本达到同等或更高的质量。
- 若实测结果可复现,对高吞吐分类、路由、评审与内容安全监控类应用是值得直接 A/B 验证的替代方案。
- 第三方实测证实 typesafeai 的 Jev 达到 GPT-5.6 Terra 同级智能 — hardimanjames · 2026-09-16
- 实测 TypeSafe Jev:响应快 5.7 倍,成本降 98%,准确率高 12 个百分点 — jon_reed · 2026-09-16
- Typesafe AI 新模型 Jev 实测:质量饱和旧评测,速度反超 Gemini 2.5 Flash Lite 6 倍 — cramforce · 2026-09-17
- Typesafe AI 的 Jev 在 Vercel 评测中跑出 100% 准确率、快 6 倍 — schwentker · 2026-09-17
- TypeSafe AI 推出评估模型 Jev,上架 Vercel AI Gateway — hackgoofer · 2026-09-17
- TypeSafe.ai 的 Jev:超快低价决策引擎,判有害内容击败主流方案还最便宜 — manubfr · 2026-09-17
- Typesafe AI 发布分类模型 Jev,成本较同类 LLM 最多降 400 倍 — hwchase17 · 2026-09-18
- Typesafe AI 发布分类模型 Jev,成本降低至 1/400 — BraceSproul · 2026-09-18
第 3 集 · Vercel fx 安全审查将换用 Jev 快 18 倍(2026-09-17,3 条)
Vercel CEO Guillermo Rauch 确认,fx auto 默认模式内置的命令安全审查器将改用 typesafeai 的 Jev。fazxes 团队的基准测试显示,Jev 在 fx auto 模式安全分类器任务上比当前首选的 GPT-5.6-Luna 快约 5 至 18 倍且准确率更高,Rauch 转发测试结果并称赞其效果显著,意味着这一替换将大幅提升 fx 默认安全审查的速度与精度。
- fx 安全分类器实测:比 GPT-5.6-Luna 快 5-18 倍且更准 — cramforce · 2026-09-17
- Vercel fx 默认安全审查将换用 Jev:比 GPT Luna 快 5-18 倍更准 — thesaraharminta · 2026-09-17
- rauchg:fx 默认模式的安全审查器用 GPT Luna 驱动,快 18 倍 — schwentker · 2026-09-17
第 4 集 · TypesafeAI 零样本分类器 Jev 上线 AI Gateway(2026-09-17,2 条)
TypesafeAI 发布零样本(zero-shot)文本分类器 Jev,现已部署在 AI Gateway 上并向所有用户开放,支持零数据保留(ZDR)。作者 yenkel 表示,便宜又快速的分类器几乎对所有公司都有用例,该工具可大幅降低聊天数据等文本的标注成本,社区反响热烈。
- TypesafeAI 发布零样本分类器 Jev,聊天数据标注成本大降 — yenkel · 2026-09-17
- typesafeai 的 Jev 分类器上线 AI Gateway,支持零数据保留 — cramforce · 2026-09-17
第 5 集 · TypeSafe 发布决策模型 Jev:不聊天、直接给答案(2026-09-17,44 条)
TypeSafe(由 ChatGPT/InstructGPT 背后的研究员之一 Diogo Almeida 创办)发布首个模型 Jev,定位不是更好的聊天机器人,而是「决策引擎」:输入应用状态加一组带类型的问题,直接输出选项、分数与概率供代码执行,完全不会生成文本。官方宣称比 LLM 快 20-200 倍、便宜 40-400 倍(输出 token 免费,输入计费约合每百万 token 0.042 美元),延迟 70-500 毫秒,采用新训练方法 RLCD。演示中 Jev 实时游玩了《地铁跑酷》,展示实时决策能力。
已确认
- Jev 采用「System One」思路:不逐 token 生成文本,而是从固定候选答案中直接选出决策并给出置信度,与 LLM 的「System Two」逐 token 生成相对。
- 延迟 70-500ms,输出 token 免费,定位为混合分类器与 LLM 之外的第三条路线。
- 独立 AI 工程师 @mostlyidempotent 的早期体验确认其返回结构化决策而非文本,延迟约 70ms。
- @mikegiannulis 做了离线回放测试(真实历史输入 + 人工标注真值,事前预设通过/失败规则):书稿素材 reranking 中,嵌入相似度把正确段落排第一的概率为 60%,Jev 提升到 90%;门户意图路由 90.5% 对原关键词路由 83.8%;「我已经做过这件事」检测 98.3% 对正则方案 96.6%;148 对忠实/捏造样本上 95% 准确、Brier 0.057;回放中还抓到此前生产环境漏判、令团队难堪的客服消息(如「请发短信别打电话」被旧分类器归入 other)。
尚未确认
- 「快 20-200 倍、便宜 40-400 倍」均为官方宣称,独立基准尚不充分;发布者身份也有传播噪音——多数转帖称「ChatGPT 联合发明者」,而 @adrianscottcom 指明 Diogo Almeida 是 InstructGPT 共同作者,具体署名口径不一。
- 小规模回放不能证明生产环境的完美校准,@mikegiannulis 自己也明确保持克制。
为什么重要
- Jev 代表「小模型补位」范式:不是替代 LLM,而是在确定性的 yes/no、路由、分类等任务上用概率化输出取代「让 LLM 写一段话再挖答案」的迂回做法。
- @mikegiannulis 同时披露失败清单:微妙措辞的作者邮件上自家 LLM 约 2:1 胜出,「太像推销」类主观判断帮不上忙,数据稀薄的销售线索评分无改进——这类盲区在 AI 排行榜上找不到,只有回放自家数据才能暴露,也为该模型的适用边界提供了少见的诚实参照。
- Jev 引发热议:很多人忘了 encoder-only 分类器早已存在且好用 — brandon_galang · 2026-09-17
- Jev 走红背后:许多人不知道 encoder-only 分类器早已成熟 — RichmanRonald · 2026-09-17
- 实测 TypeSafe 判断模型 Jev:六大场景,速度比 Gemini 快 4 倍 — HamelHusain · 2026-09-18
- 用 Jev 判断模型做六件事:核查脚本到诊断 Agent 失败 — HamelHusain · 2026-09-18
- 前 ChatGPT 联合发明者发布 Jev:宣称快 200 倍、便宜 400 倍 — iamrobotbear · 2026-09-18
- 开源分类器模型 Jev 走红背后:很多 AI 开发者连分类器都写不出来 — edgarpavlovsky · 2026-09-18
- 自称 ChatGPT 联合发明者隐身两年,发布「决策专用」新模型 Jev — threepointone · 2026-09-18
- 自称 ChatGPT 联合发明者发布新模型 Jev:宣称快 20-200 倍、便宜 40-400 倍 — hardimanjames · 2026-09-18
- ChatGPT 研究员创办 TypeSafe,首发模型 Jev 只做决策不写字 — Scobleizer · 2026-09-18
- 前ChatGPT共同作者隐身两年推出Jev模型,检测API宣称便宜百倍 — gaganghotra_ · 2026-09-18
- 放弃自回归的 Jev 模型:只输出结构化决策的另类路线 — karminski3 · 2026-09-18
- 非自回归决策模型 Jev:70ms 出结构化决策,输入仅 $0.042/百万 token — karminski3 · 2026-09-18
- 非聊天模型 Jev 主打 70-500ms 概率判断,输出免费每百万 token 仅 0.042 美元 — adrianscottcom · 2026-09-18
- Jev 模型详解:不写文本、单次前向输出结构化决策的新范式 — blaizedsouza · 2026-09-18
- 自称 ChatGPT 共同发明者推出 Jev 模型,宣称快 20-200 倍、便宜 40-400 倍 — HankYeomans · 2026-09-18
- 自称 ChatGPT 联合发明者推出新模型 Jev:号称快 20-200 倍、便宜 40-400 倍 — multiply_matrix · 2026-09-18
- 自认 ChatGPT 共同发明者发布新模型 Jev,宣称快 20-200 倍、便宜 40-400 倍 — multiply_matrix · 2026-09-18
- ChatGPT 联合发明人隐身两年,发布宣称快 200 倍的新模型 Jev — multiply_matrix · 2026-09-18
- 开发者点评 Jev:大量分类任务不该硬塞给 LLM,浏览器端可廉价运行 — GabGarrett · 2026-09-18
- ChatGPT 联合发明人推出 Jev:宣称比 LLM 快 20-200 倍、便宜 40-400 倍 — GabGarrett · 2026-09-18
第 6 集 · TypeSafe AI 评估模型 Jev 上线 Vercel 与 Cloudflare 网关(2026-09-17,4 条)
TypeSafe AI 推出评估模型 Jev,定位为「首个 System One 模型」,可让 Agent 在毫秒内完成决策、路由、评分与停止。它通过单次 API 调用对共享状态回答带类型定义的问题,返回选择、分数与布尔判定。Jev 已上线 Vercel AI Gateway 和 Cloudflare AI Gateway,输入定价为每百万 tokens 0.04 美元,开发者虽部分尚无直接访问权限,但均可经网关调用。
- Typesafe AI 发布 Jev:毫秒级决策路由评分模型,已上线 Vercel AI Gateway — cramforce · 2026-09-17
- Jev 评估模型已可通过 Vercel AI Gateway 使用,每百万 token 仅 0.04 美元 — jarrodwatts · 2026-09-17
- TypeSafe 推出结构化评估模型 Jev,登陆 Cloudflare AI Gateway — michellechen · 2026-09-18
- TypeSafe AI 推出评估模型 Jev,单次 API 调用搞定结构化判定,输入定价 $0.04/百万 tokens — multiply_matrix · 2026-09-18
第 7 集 · Typesafe AI 发布高速分类模型 Jev 实测便宜五倍(2026-09-17,2 条)
Typesafe AI 发布主打 System 1 快速思考的新模型 Jev,专注于高速度分类任务而非长链推理。开发者 grichadev 实测将其用于安全流水线,发现相比此前为控制成本而使用的小模型,Jev 成本便宜 5 倍以上、速度更快,且准确率明显更高。Sam Witteveen 也对该模型进行了实测介绍。
- 新模型 Jev 实测:安全流水线成本低 5 倍、更快且更准 — zeeg · 2026-09-17
- Typesafe AI 发布超高速分类模型 Jev,主打 System 1 思维 — Sam Witteveen · 2026-09-18
第 8 集 · 实测 Jev 推文分类:比最快 LLM 快 6 倍、便宜 40 倍(2026-09-17,2 条)
开发者 altryne 将 TypeSafe 推出的 Jev 接入自己的 Chrome 扩展 Twitter Timeline Analyzer,用于 AI 分析并过滤「For You」推荐流、检查其是否被单一话题绑架。实测显示,相比此前部署在 Cerebras 上的最快、最便宜 LLM,Jev 做推文分类速度快 6 倍、成本低 40 倍,展示了专用小模型在分类任务上的性价比优势。
- 开发者实测:Jev 做推文分类比最快 LLM 便宜 40 倍 — altryne · 2026-09-17
- 换用 Jev 给推文分类:比最快 LLM 快 6 倍、便宜 40 倍 — altryne · 2026-09-17
第 9 集 · Jev 模型直出结构化决策,$0.042/M token 替代文本解析(2026-09-18,2 条)
作者吐槽团队让能写小说的大模型回答「这条消息归哪个桶」再写代码解析文本的荒诞现状。TypeSafe AI 的 Jev 模型跳过文本生成,直接输出选项、分数和概率,价格仅 $0.042/M token。一家 AI 写书公司把 3300 条真实生产决策在 Jev 上离线回放,用历史 Claude 决策和人工标注真值对比,一个下午仅花 20 美分完成验证。
- 用写作模型做消息分类太浪费:Jev 以 $0.042/M token 直出结构化决策 — mikegiannulis · 2026-09-18
- 用 3300 条真实生产决策离线回放,一个下午 20 美分验证 Jev 路由 — mikegiannulis · 2026-09-18