JEV 生产落地清单:置信度是边际不是正确率,阈值要按动作代价分层
sven_ai · x · 2026-09-24
一篇关于把 TypeSafe AI 的「System One」决策模型 JEV(9 月 15 日早期访问、9 月 20 日开放注册)安全接入生产流量的工程清单。JEV 只吃 state + questions,返回带校准概率的类型化答案,官方声称 RLCD 训练让置信度越高越准,但作者强调这只在聚合意义上成立,直接上线不校准会悄悄跑偏。
关键要点:
- 阈值校准:文档中的置信度公式 (n × pmax − 1) / (n − 1) 度量的是分布集中度(margin/边际),不是答案正确率;Noul 则直接把 01 的信念值阈值化。
- 分层阈值:网上流传的三档默认值(>0.9 自动执行 / 0.50.9 二次确认或升级强模型 / <0.5 转人工)只能当起点,真正规则是按动作代价分层——读操作 0.5 即可,动钱要 0.9,不可逆操作叠加人工确认;官方也承认 thresholds 是 use-case-specific。
- 文章附有 typesafe-sdk 的安装与路由代码示例,并强调日志与回放评测的重要性。
「编程与Agent」频道最新
- 纯代码渲染电影级海难预告片:73 秒生成,无 AI 模型参与 — NathanWilbanks_ · 2026-09-24
- 整场语音 demo 只花约 2 美分:KugelAudio 每分钟语音 0.035 美元 — tobowers · 2026-09-24
- 零美国公司数据链路搭实时语音 agent:Gladia STT + Gemma 4 + KugelAudio TTS — tobowers · 2026-09-24
- 开发者自述:给 agent 塞 10 倍测试用例,只为拖慢它的速度 — cjimti · 2026-09-24
- 截图圈注让 AI 改网页:Ling-3.0 实测三轮仅两轮通过 — alifcoder · 2026-09-24
- 提交 MCP 服务到 Claude 目录,5 分钟即获审核通过 — devenbhooshan · 2026-09-24