Simon Willison 评 Jev:输出浮点数的「决策模型」新物种
Simon Willison · rss · 2026-09-22
Simon Willison 撰文分析 TypeSafe AI 新发布的 Jev——被官方称为「System One 模型」、他更愿意叫「决策模型」的新类别:输入仍是文本,但输出不是文字,而是对应类别、是非判断、评分及置信度的浮点数。要点:
- 定价激进:只按输入 token 计费,输出免费,首个模型 $0.042/百万 token,比 GPT-5 Nano($0.05/M)还便宜。
- 三种问题类型:Noul(Bernoulli)是非题返回 0-1 置信度;选择题返回选项概率分布;评分题沿自定义数值区间打分。一个 state 可并行挂任意多问题,耗时与单问相近。
- 适用场景:分类类任务——垃圾检测、打标签、排序;Willison 自己试了搜索重排(BM25 取 100 条候选再让 Jev 打分)。
- 黑盒担忧:Jev 比普通 LLM 更黑盒——只给浮点数、不给理由,偏见问题更突出(他担心有人拿来筛简历);一个实验里它给湾区城市打「好城市」分,Cupertino 最高、East Palo Alto 最低。evals 因此更重要,好在足够便宜可跑上千次实验。
- 社区玩法:jevchat(把 Jev 变成极差聊天模型)、jev-leftpad(用选择题实现 left-pad)、jev-2048(玩滑块游戏)。
- 开源复刻潮:基于 Qwen 3.5 的开源复刻 Kev(0.8B/4B/9B),还冒出了 JevBench 基准。发布不到一周生态已相当热闹。
「模型」频道最新
- 论战补充:用前沿模型攻数学难题仍是「极客专属」 — felpix_ · 2026-09-22
- Meta Muse 曝零日漏洞,本地进程可窃取提示词与认证凭据 — MicahBerkley · 2026-09-22
- Grok 4.7 现身:用户热议新模型,期待用量额度重置 — BWay124 · 2026-09-22
- 延续争论:OpenAI 招揽博士团队正是为驾驭前沿模型 — felpix_ · 2026-09-22
- 研究者:普通人靠 prompt 难让模型解决自然科学难题 — felpix_ · 2026-09-22
- 开发者热论:基准测试毫无意义,模型之间只剩「感觉」差异 — gnukeith · 2026-09-22