决策模型 Jev 深度实测:准确与校准是两回事,周一就能照做
colinmcnamara · x · 2026-09-21
Colin McNamara 发布长文《A Model That Refuses to Talk》,深度拆解并实测 TypeSafe 的决策模型 Jev。要点:
- 核心观点:业务代码需要的是「决策」,却在向聊天模型要一句散文再解析回结构;structured output 只修形状,不修错配,而 JSON 里的 confidence 只是生成的估计,不是校准证据。
- 背景:Jev 被定义为「第一个 System One 模型」,9 月 15 日开放早期访问,DCVC 领投 4000 万美元种子轮。
- 实测结果:情感 94.0%、新闻主题 88.2%(零样本零调参);单题 143ms;ECE 约 0.09,情感上欠自信、新闻顶部区间过度自信;自有 GPU 上的开源 27B 模型校准水平相当。
- 可行动清单:在自己的标注数据上测校准;按错误成本设阈值;锁定模型版本;准确率与校准是两个独立属性,两者都要检查。
所属事件:决策模型上线三步法:测校准、按代价设阈值、锁版本(2 条相关)→
「模型」频道最新
- 260 万美元 RL 就近 SOTA:数据成本会否超过训练成本? — my_cat_can_code · 2026-09-21
- 模仿人类社交节奏:humansand 发布 Persimmon 模型与 Trickle Test — niloofar_mire · 2026-09-21
- 为什么让 LLM 回「是/否」更快:输出 token 越少越快 — tinyfool · 2026-09-21
- 曝 ChatGPT 免费用户获无限文本对话,默认模型同步升级 — nikola_mr64990 · 2026-09-21
- 用户吐槽 Astra 太贵太耗 token,盼 GPT-6 降本 — CtrlAltDwayne · 2026-09-21
- TypeSafe JEV 模型全量开放:每人 5 美元免费额度,秒级搭 3D 场景 — tinyfool · 2026-09-21