JEV决策模型走红:把Agent的「小判断」从大模型账单里剥离
大模型之路 · wechat · 2026-09-29
文章分析 TypeSafe 的 JEV「决策模型」为何在 Agent 圈爆火:核心洞察是 Agent 调用日志里大多数请求其实是在做判断(分类、门控、评分),而非生成内容,却为这些判断付了大模型的延迟和 token 成本。
- 成本错配:工单分流、元素点击选择、危险操作判断等高频小判断,本只需从有限集合选一个选项,却被逼着生成文本再解析,又贵又慢
- 三种题型:Noul(是/否,返回概率)、Choice(最多 255 选项)、Score(连续分值),喂一段状态加一组预定义问题,一次性并行算完
- 置信度门限:输出自带把握值,高则自动执行、低则转人工或升级到大模型复核,把「该不该信任判断」变成可配置策略
- 快慢分工:规划推理交给前沿大模型,细碎判断交给 JEV,由 Harness 调度;大模型调用减少但每步响应更快
- 开源侧进展:JEV 官方闭源且未对中国大陆开放,但 APUS 实验室发布 MIT 协议的开源复现 fast-browser-use,支持 macOS/Linux/Windows,底层用本地 Qwen3.5-9B 单次前向直接决定「点哪里」,回避选择器错误和格式幻觉
适用判断标准:答案本该从有限集合里挑、高频、延迟敏感(工单分流、意图识别、内容审核、线索打分、风险门控)。需要解释推理过程、可审计决策的场景不适合硬套。
所属事件:TypeSafe 决策模型 Jev 发布:不生成文本,快且廉价的窄域判断(6 条相关)→
「编程与Agent」频道最新
- 实测把 /autocompact 调到 400k,每周 Claude 用量省 29% — rickasaurus · 2026-10-10
- Eazo 体验:一句话生成可上线 App,含收款与返佣体系 — vista8 · 2026-10-10
- Grok Bot 嵌套运行 Hermes Agent VM,实现多层并行智能体 — alexcovo_eth · 2026-10-10
- Brian Holt:卖掉 42U 机架,一台 Framework 桌面加编码 Agent 更实用 — film_girl · 2026-10-10
- Group-Evolving Agents 获 COLM 2026 奖:SWE-bench 71% 超越人类设计框架 — xwang_lk · 2026-10-10
- 开发者观察:让 agent 修你不懂的 bug,就是现实版连续回形针最大化 — brandon_xyzw · 2026-10-10