实测 Jev 一天后:一个快得离谱的分类器,不是 GPT 替代品
jiayuan_jy · x · 2026-09-18
作者花一天时间研究了 @typesafeai 的 Jev,结论是:新鲜感消退很快,它更像一个更快、更受约束的通用分类器/决策器——LLM 本来就能做这些事。
核心判断:
- 底层模型大小未知(估计不大),世界知识可能不如典型 LLM 广,复杂场景下决策可靠性存疑
- 适合「有限选项集合 + 严格延迟要求」的任务;受约束的输出格式可以在代码层面保证输出合法
- 计算机使用(computer use)是天然契合场景:页面 DOM 元素是有限集合,可以构建「DOM 列表 → Jev 决策 → 新 DOM 列表」的循环;但长上下文下的推理能力未经验证,作者猜能力不如 GPT 6 Astra,只是快
- 不能替代 tool use:工具调用参数(如编辑工具的具体行号和替换文本)无法预先枚举成有限选项,作者在重写 Pi Agent 时发现可替换点比预期少;compaction 这类场景 LLM 也能做,差异化不大
- 更大的潜力在决策树逻辑、对延迟极敏感的领域:游戏 AI、机器人、自动驾驶
进行中的实验: 1) 德州扑克 AI——决策树深、复杂,正在做 Jev 与其他模型的正面对抗赛;2) Pokémon VGC(双打对战)AI——数据充足,目前没有好的练习对手,计划打天梯。不过两者都是回合制,LLM 也能胜任,只算是测试场。
「编程与Agent」频道最新
- Awesome Code-as-X 合集:用程序作为中间表示统一 agent 研究 — ccloy · 2026-09-18
- 实测 8 个 AI 个人助理无一个能替你给朋友发短信,卡在 10DLC — iamstanty · 2026-09-18
- Zalando 在 Kubernetes 上构建内部 Agent 平台的规模经验 — bibryam · 2026-09-18
- 开发者调侃新编程流程:发推恶搞概念,再丢给编码 Agent — airesearch12 · 2026-09-18
- 开发者吐槽 Opus 5 连构建运行项目都搞不定 — lucasmeijer · 2026-09-18
- Cloudflare Workers 上实测新推理能力:搜索重排快 7 倍,打标快 GLM 50 倍 — iannuttall · 2026-09-18