实测 Jev 一天:它更像低延迟决策器,Computer Use 是最佳场景
jiayuan_jy · x · 2026-09-18
作者研究了一整天 Jev 后的判断:它本质上是一个更快的通用分类器/决策器,LLM 完全能做同样的事,优势在于速度,且因参数规模可能不大,世界知识未必比常规 LLM 全,复杂场景决策准确性存疑。
适合的场景
- 有限解空间 + 低延迟要求的问题,配合形式化输出可从程序上保证正确性
- Computer Use:网页 DOM 元素是有限集,可用「dom list → jev action → new dom list」循环驱动操作,但推理能力和长上下文表现尚无 benchmark
- 依赖决策树的实时场景:游戏 AI、机器人、自动驾驶
在 Agent 中的实测
作者尝试用 Jev 重写 Pi Agent 的部分模块:tool using 的选择不能用 Jev 代替,因为每步工具调用带有具体参数(如 edit tool 的行号),不在有限集内;但 Compaction 等分类环节可以让 Jev 快速完成(与 LLM 差异不大)。
进行中的 demo:Poker AI(决策树长且复杂,用 Jev 与其他模型对抗式 battle,吐槽 GTO Wizard 难用)和 Pokemon VGC 双打对战 AI(数据全、适合研究决策,做完打算实际打排位)。
所属事件:前 ChatGPT 成员推出决策模型 Jev:只出决策不写文本(63 条相关)→
「编程与Agent」频道最新
- 用 Jev 给 Supabase RLS 策略做语义审计,揪出规则型 lint 漏掉的漏洞 — SeanOliver · 2026-09-19
- 用 RealSense D436 深度相机做虚拟绿幕:按距离过滤 RGB,无需背景布 — chrismatthieu · 2026-09-19
- Runway MCP 一句 prompt 即可将视频转换为 120fps — tlakomy · 2026-09-19
- 实测成本曝光:100 次模型调用仅花约四分之一美分 — narphorium · 2026-09-19
- 开发者造英文逻辑语言解释器,让 LLM 借外部证明搜索做推理 — narphorium · 2026-09-19
- AgenticLinux:为AI Agent预装全套工具的不可变Linux发行版 — steipete · 2026-09-19