4千万美元押注「校准置信度」,TypeSafe却未公开任何校准数据
prakersh · reddit · 2026-09-21
TypeSafe AI 于 9 月 15 日结束隐身,DCVC 领投 4000 万美元,估值据报 2 亿美元,创始人 Diogo Almeida 是前 OpenAI 研究员,参与过 InstructGPT、ChatGPT 和 GPT-4。其模型 Jev 不生成文本,而是接收程序状态加带类型的问题,返回带概率的带类型答案,训练方法自称「校准决策强化学习」,卖点是概率经过校准——说 70% 就该对 70%。
作者的核心质疑:
- 校准是全部卖点,却没有任何公开测量:没有 ECE、没有可靠性图、没有标准公开基准、没有架构论文。唯一公开的是公司自设的四项工作流评测,正确答案被定义为 GPT-6 Astra 与 Claude Fable 5.1 高思考模式输出的平均值——这测的是与两个竞品模型的一致度,不是正确性;且竞品在默认推理设置下运行,193.6 倍速度与 444.6 倍成本优势是对着「关推理」配置测的,而准确率目标来自「开推理」配置。
- 「不会幻觉」只在狭义上成立:输出空间在解码前固定,无法吐出列表外的选项,消除了编造输出,但不保证所选选项正确;约束解码也不新鲜,OpenAI 自 2024 年 8 月就支持 JSON Schema 保证。
作者认为该停止怀疑的地方:Vercel 报告 Jev 是 AI Gateway 史上采用最快的模型,18 小时内覆盖十分之一付费团队,24 小时近 13%,约为 Fable 5.1 首日份额的六倍;且 TypeSafe 自家文档异常坦诚,公开了模型「锯齿」页面,承认 Jev 计数不可靠、在十六进制和 RGB 值上表现差、无法判断两值是否接近、把日期当文本读,还承认语义相关输出之间没有保证的数学关系,一个命题与其否定的概率不必和为 1。结论:真产品、真采用,但核心属性无人外部验证过。
所属事件:TypeSafe获4000万美元融资,校准宣称遭质疑(2 条相关)→
「创投」频道最新
- 用 AI 重读 Yandex 泄露代码:行为信号数量是内容信号的 3 倍 — tracyingram · 2026-09-21
- 小模型更便宜是错觉:审查与返工成本让整体账单更高 — zeuslac · 2026-09-21
- 独立开发者晒 SEO 工具战报:日曝光从 2 千涨到 2.3 万 — tibo_maker · 2026-09-21
- 智谱、月之暗面、DeepSeek 五个月融资约 350 亿美元,或达 600 亿 — FinanceYF5 · 2026-09-21
- AI 让创业更难而非更容易,选对赛道成关键 — 0xsachi · 2026-09-21
- 开发者吐槽同行在评论区刷屏营销,百万播放也没换来用户 — willcb · 2026-09-21