TypeSafe 4000万美元出 stealth,但 Jev「永不幻觉」与校准宣称被逐条拆解

prakersh · reddit · 2026-09-21

TypeSafe AI 于 9 月 15 日出 stealth,获 DCVC 领投 4000 万美元,估值约 2 亿,发布模型 Jev,创始人是前 OpenAI 研究员 Diogo Almeida(曾参与 InstructGPT、ChatGPT、GPT-4)。作者将其两大核心宣称分开审视:

宣称一:不会幻觉——属实但比听上去窄。 Jev 不生成自由文本,而是接收程序状态加类型化问题,返回带概率的类型化答案,输出空间固定,物理上无法产生列表外的捏造内容。但「格式合法」不等于「答案正确」。Constrained decoding 并不新:OpenAI Structured Outputs 自 2024 年 8 月起就保证 100% JSON Schema 合规,固定选项打分也是 MMLU 自 2020 年以来的评测方式。Jev 的真实贡献是零样本跨领域做到微调分类器级别的效果。

宣称二:概率已校准——公开层面零证据。 产品核心是每个答案附带概率(70% 即约七成正确),训练方法名为 RL for Calibrated Decisions。但目前没有 ECE、可靠性曲线、公开基准成绩或架构论文;公司自设的评测以 GPT-6 Astra 和 Claude Fable 5.1 的高推理档输出均值作参考标签,衡量的是与竞品的一致性而非正确性;193.6 倍速、444.6 倍成本优势也是拿推理关闭的竞品来比,而公司融资稿只称最高 100 倍。

真正硬的数据来自第三方: Vercel 称 Jev 是 AI Gateway 史上采用最快的模型——18 小时内覆盖十分之一付费团队,24 小时达近 13%,首日份额是 GPT-5.6 系列的 2 倍、Fable 5.1 的 6 倍。同时 TypeSafe 自家文档相当坦诚:Jev 数数不可靠、hex/RGB 判断差、日期按文本读,且语义相关输出的概率无数学保证(陈述与其否定的概率之和不必为 1)——这与校准叙事相矛盾。作者结论:在校准被独立验证之前,Jev 最强证据只有「开发者用得快」,这证明的是有用性而非校准。

所属事件:TypeSafe获4000万美元融资,校准宣称遭质疑(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →