实测 TypeSafe 分类模型 Jev:整套校准实验成本不到 4 美元
RexDouglass · x · 2026-10-07
Dylan Black 撰文实测 TypeSafe 新发布的「System One」分类模型 Jev(类比《思考,快与慢》:LLM 是慢而通用的 System Two,Jev 这类 Decision Model 是快而专的 System One)。
- Jev 在预训练 transformer 末端接分类头,给出上下文+多选题即输出带类型的结果和概率分布,如 jev("2+2=?", "3 : int, 4 : int, 5 : int") 返回 4
- 极其便宜:作者整套实验花费不到 4 美元
- 核心问题:它给出的概率分布校准得如何?作者用答案已知的问题做了系统的校准检验,结论是「Jev 校准不佳」
「模型」频道最新
- 前 _xjdr 点名四个值得关注的开源模型:dsv4.1 flash、GLM 5.3 在列 — _xjdr · 2026-10-07
- 研究员 _xjdr 力挺 inkling 架构:与 DSV4 同列新晋最爱 — _xjdr · 2026-10-07
- 开发者实测 OpenAI Decisions API:超 65% 请求需回退,误判雕像为人脸 — taufiqintech · 2026-10-07
- X 平台已下线 @grok 提问功能,用户仍在惯性艾特 — BLUECOW009 · 2026-10-07
- 用户直呼 Opus 5.5「就是懂」:模型行为口碑持续发酵 — rudrank · 2026-10-07
- Teknium 回应评测争议:半数 Hermes 用户拿来写代码 — Teknium · 2026-10-07