专题 · FULL STORY

TypeSafe 惊艳亮相:决策模型 Jev 从发布到实测

隐身两年的 TypeSafe 于 9 月 16 日结束保密,发布首个 System One 决策模型 Jev 与新训练法 RLCD。凭借毫秒级决策与极低价格,Jev 迅速接入 Vercel、Cloudflare 网关,实测显示比最快 LLM 快数倍、便宜数十倍,引发广泛讨论。

2026-09-16 ~ 2026-09-18 · 9 集 · 153 条

第 1 集 · TypeSafe 结束隐身发布决策模型 Jev 与新训练法 RLCD(2026-09-16,86 条)

9 月 16 日,隐身约两年的新实验室 TypeSafe 结束保密状态,发布首个 System One 模型 Jev 与配套的新训练方法 RLCD。创始人 Diogo Almeida(X 账号 @CompleteSkeptic)自称曾在 OpenAI 参与 ChatGPT 背后的指令遵循研究,多条转发帖以「ChatGPT 联合发明者」称呼他,但这一身份为自我表述,未经独立核实。目前所有性能宣称均为发布方单方面说法,尚无独立评测,部分转发帖中已出现质疑与群嘲。

已确认

  • TypeSafe 发布了新模型 Jev 与新训练方法 RLCD。据 @rohanpaulai 介绍,Jev 是该公司首个 System One 模型;多条转发帖转述 Diogo Almeida 是 InstructGPT 论文作者之一。
  • Jev 定位不是聊天模型,而是「决策智能」:用自然语言提问(包括模糊、主观的问题),返回 yes/no 或自定义类别的概率,以纯 API 形态提供,不做文本生成。@hardimanjames 转述的典型用例是给客服工单问「这个客户听起来生气吗」,返回 0.9 这样的概率,典型响应约 0.7 秒。@bindureddy 将其概括为一个能在多选项面前做智能决策的分类器,认为这类近乎免费的分类能力对任何 agent 平台都是很好的补充(其「智能水平可比大模型」的说法为发布方口径);她在后续帖中进一步提出,Jev 这类单次前向传播直接输出选项概率的小模型可作为决策器,缓解当前 Agent 架构串行执行(选工具、分支、重试)的痛点,让 Agent 并行推进千步。
  • 产品分工思路是让大模型处理难的推理任务,把路由、欺诈检测、内容审核、验证等海量小型决策交给 Jev 这类小模型。技术路线上不做逐 token 自回归生成,而是将非结构化状态并行输出为类型安全的概率决策。@FrankFelixAI 的对比指出,Jev 用并行计算替代串行计算,与当年 Transformer 凭同样思路超越 RNN 的逻辑相似,代价是无法生成文本,推理快、成本低,只适合分类类任务。The AI Daily Brief 的视频解读也持类似看法,认为大量业务任务本质上只需校准的概率判断而非文本生成。
  • 据 @Profanion 转述 The Register 报道,厂商宣称 Jev 幻觉率远低于传统大模型,输出成本也便宜得多。
  • 发布方宣称的性能:比现有模型快 20-200 倍、便宜 40-400 倍,输出 token 免费,响应低于 500ms,并称不产生幻觉。@heyabusiddik 的转述给出输入定价为每百万 token $0.042。@TheMoonMidas 的转述称比 Opus 便宜 155 倍、快 20 倍;@soumitrashukla9 一则转述则称比 Fable 级判断快 25 倍、便宜 600 倍,并将 Jev 比作工作流中的「智能 if 语句」——各转发数字略有出入,均源自发布方。
  • 发布方还展示了 Jev 实时玩《毁灭战士》的演示,以体现其低延迟决策能力(据 @alexcovoeth 转述)。

尚未确认

  • 上述速度、成本与「零幻觉」均为发布方单方面宣称,暂无系统性独立评测或基准验证。
  • 「ChatGPT 联合发明者」为创始人自我表述,多数转发帖使用「自称」措辞,@bennash 也明确标注未证实、可信度存疑;具体身份认定主要来自转述(InstructGPT 论文作者之一),尚未经独立核实。@mohbibi 的转发中出现质疑声音,怀疑 Jev 实际上只是专用扩散模型;@karmay007 的转述也提到相关宣称遭到群嘲,暂无官方回应或佐证。

为什么重要

  • 若宣称的延迟与成本成立,Jev 可能显著降低在自动化流程中嵌入大量判断调用的门槛,直击当前 agent 工作流的成本痛点。@bindureddy 从架构角度提出的「决策器解放 Agent 串行瓶颈」是值得跟踪的应用假想。
  • 「结构化概率输出而非生成文本」代表了一条与主流聊天模型不同的产品化路径,值得后续关注第三方评测、创始人身份信息与技术原理的进一步核实。

还有 66 条相关讨论 →

第 2 集 · TypeSafe AI 发布专用评估模型 Jev,实测速度与成本优势显著(2026-09-16,8 条)

TypeSafe AI 发布专用评估模型 Jev,并已接入 Vercel AI Gateway。该公司由 LangChain 的 Sydney Runkle 与 Hunt Lovell 参与打造,官方宣称 Jev 在分类任务上相比同级别 LLM 最多提速 200 倍、降低成本 400 倍。多位开发者的独立实测显示,这款模型在结构化判断任务上速度和成本优势显著,质量达到甚至超越了此前使用的旗舰轻量模型,正在引发「用专用小模型替代通用大模型做分类路由」的讨论。

已确认

  • 据 @hackgoofer,Jev 定位为「System One」评估模型,面向软件中的快速结构化判断:对共享状态回答带类型的问题,返回选项、分数与布尔概率,支持分类、路由等场景,已接入 Vercel AI Gateway。
  • 开发者 cramforce 将 Jev 接入原本基于 Gemini 2.5 Flash Lite 的分类器评测,结果质量直接把评测跑饱和(100% 准确率),同时速度快 6 倍。
  • @jonreed 所在的 Near Here 团队获得早期访问权限,将其用于本地活动数据验证并逐一调优 prompt:响应速度最高提升 5.7 倍,成本降低 98%,准确率提升 12 个百分点。
  • @hardimanjames 转述 N8Programs 的实测:在 MMLU、GPQA 等多个选择题基准上对比,验证了 Jev 在 System 1 任务上的智能可与 GPT-5.6 Terra 媲美。
  • @manubfr 拿到访问权后测试 Jev 用作对齐监控器:在 4 个公开 benchmark 上评测其对有害内容的判断,称击败主流方案且价格最便宜。
  • 据 @hwchase17 转发,Jev 由 LangChain 团队成员 Sydney Runkle 与 Hunt Lovell 参与打造,官方口径为最高 200 倍速度/400 倍成本优化。

尚未确认

  • 各项对比数据均来自第三方或早期访问用户的自述,尚未见独立复现;「Luna 级智能」及 200/400 倍优化为厂商宣称口径。

为什么重要

  • 四组独立的真实生产/评测替换都指向同一结论:在结构化判断类任务上,专用评估模型可以用远低于通用大模型的延迟和成本达到同等或更高的质量。
  • 若实测结果可复现,对高吞吐分类、路由、评审与内容安全监控类应用是值得直接 A/B 验证的替代方案。

第 3 集 · Vercel fx 安全审查将换用 Jev 快 18 倍(2026-09-17,3 条)

Vercel CEO Guillermo Rauch 确认,fx auto 默认模式内置的命令安全审查器将改用 typesafeai 的 Jev。fazxes 团队的基准测试显示,Jev 在 fx auto 模式安全分类器任务上比当前首选的 GPT-5.6-Luna 快约 5 至 18 倍且准确率更高,Rauch 转发测试结果并称赞其效果显著,意味着这一替换将大幅提升 fx 默认安全审查的速度与精度。

第 4 集 · TypesafeAI 零样本分类器 Jev 上线 AI Gateway(2026-09-17,2 条)

TypesafeAI 发布零样本(zero-shot)文本分类器 Jev,现已部署在 AI Gateway 上并向所有用户开放,支持零数据保留(ZDR)。作者 yenkel 表示,便宜又快速的分类器几乎对所有公司都有用例,该工具可大幅降低聊天数据等文本的标注成本,社区反响热烈。

第 5 集 · TypeSafe 发布决策模型 Jev:不聊天、直接给答案(2026-09-17,44 条)

TypeSafe(由 ChatGPT/InstructGPT 背后的研究员之一 Diogo Almeida 创办)发布首个模型 Jev,定位不是更好的聊天机器人,而是「决策引擎」:输入应用状态加一组带类型的问题,直接输出选项、分数与概率供代码执行,完全不会生成文本。官方宣称比 LLM 快 20-200 倍、便宜 40-400 倍(输出 token 免费,输入计费约合每百万 token 0.042 美元),延迟 70-500 毫秒,采用新训练方法 RLCD。演示中 Jev 实时游玩了《地铁跑酷》,展示实时决策能力。

已确认

  • Jev 采用「System One」思路:不逐 token 生成文本,而是从固定候选答案中直接选出决策并给出置信度,与 LLM 的「System Two」逐 token 生成相对。
  • 延迟 70-500ms,输出 token 免费,定位为混合分类器与 LLM 之外的第三条路线。
  • 独立 AI 工程师 @mostlyidempotent 的早期体验确认其返回结构化决策而非文本,延迟约 70ms。
  • @mikegiannulis 做了离线回放测试(真实历史输入 + 人工标注真值,事前预设通过/失败规则):书稿素材 reranking 中,嵌入相似度把正确段落排第一的概率为 60%,Jev 提升到 90%;门户意图路由 90.5% 对原关键词路由 83.8%;「我已经做过这件事」检测 98.3% 对正则方案 96.6%;148 对忠实/捏造样本上 95% 准确、Brier 0.057;回放中还抓到此前生产环境漏判、令团队难堪的客服消息(如「请发短信别打电话」被旧分类器归入 other)。

尚未确认

  • 「快 20-200 倍、便宜 40-400 倍」均为官方宣称,独立基准尚不充分;发布者身份也有传播噪音——多数转帖称「ChatGPT 联合发明者」,而 @adrianscottcom 指明 Diogo Almeida 是 InstructGPT 共同作者,具体署名口径不一。
  • 小规模回放不能证明生产环境的完美校准,@mikegiannulis 自己也明确保持克制。

为什么重要

  • Jev 代表「小模型补位」范式:不是替代 LLM,而是在确定性的 yes/no、路由、分类等任务上用概率化输出取代「让 LLM 写一段话再挖答案」的迂回做法。
  • @mikegiannulis 同时披露失败清单:微妙措辞的作者邮件上自家 LLM 约 2:1 胜出,「太像推销」类主观判断帮不上忙,数据稀薄的销售线索评分无改进——这类盲区在 AI 排行榜上找不到,只有回放自家数据才能暴露,也为该模型的适用边界提供了少见的诚实参照。

还有 24 条相关讨论 →

第 6 集 · TypeSafe AI 评估模型 Jev 上线 Vercel 与 Cloudflare 网关(2026-09-17,4 条)

TypeSafe AI 推出评估模型 Jev,定位为「首个 System One 模型」,可让 Agent 在毫秒内完成决策、路由、评分与停止。它通过单次 API 调用对共享状态回答带类型定义的问题,返回选择、分数与布尔判定。Jev 已上线 Vercel AI Gateway 和 Cloudflare AI Gateway,输入定价为每百万 tokens 0.04 美元,开发者虽部分尚无直接访问权限,但均可经网关调用。

第 7 集 · Typesafe AI 发布高速分类模型 Jev 实测便宜五倍(2026-09-17,2 条)

Typesafe AI 发布主打 System 1 快速思考的新模型 Jev,专注于高速度分类任务而非长链推理。开发者 grichadev 实测将其用于安全流水线,发现相比此前为控制成本而使用的小模型,Jev 成本便宜 5 倍以上、速度更快,且准确率明显更高。Sam Witteveen 也对该模型进行了实测介绍。

第 8 集 · 实测 Jev 推文分类:比最快 LLM 快 6 倍、便宜 40 倍(2026-09-17,2 条)

开发者 altryne 将 TypeSafe 推出的 Jev 接入自己的 Chrome 扩展 Twitter Timeline Analyzer,用于 AI 分析并过滤「For You」推荐流、检查其是否被单一话题绑架。实测显示,相比此前部署在 Cerebras 上的最快、最便宜 LLM,Jev 做推文分类速度快 6 倍、成本低 40 倍,展示了专用小模型在分类任务上的性价比优势。

第 9 集 · Jev 模型直出结构化决策,$0.042/M token 替代文本解析(2026-09-18,2 条)

作者吐槽团队让能写小说的大模型回答「这条消息归哪个桶」再写代码解析文本的荒诞现状。TypeSafe AI 的 Jev 模型跳过文本生成,直接输出选项、分数和概率,价格仅 $0.042/M token。一家 AI 写书公司把 3300 条真实生产决策在 Jev 上离线回放,用历史 Claude 决策和人工标注真值对比,一个下午仅花 20 美分完成验证。