Jev 高频实测摸底:中文拉胯、无推理,只适合封闭小决策
ZeYanjie · x · 2026-09-20
作者几天高频实测后总结 Jev 的能力边界:它极其依赖使用者划定的严格约束,开放复杂任务行不通。
- 中文适配差:官方文档标注 CJK 准确率偏低,实测中文结果混乱;英文短文本相对稳定。
- 无推理能力:Browser Use 创始人的长程浏览器交互测试中 Jev 仅 1/20,远落后具备推理能力的 Luna(17/20)。
- 真实网页不行:公开演示多在结构规范、无干扰的沙盒环境;面对未清洗 DOM、异步加载与弹窗缺乏应对。
- “零幻觉”不等于判断正确:官方只保证输出符合预定义 JSON Schema,CEO 也确认存在自信选错的情况。
- 无法动态生成工具调用参数:如指定代码行号、生成代码片段等无限维参数空间覆盖不了。
- 不输出推理依据:只返回选项或数值,无法满足人工复核与合规审计需求。
结论:Jev 的适用场景非常细分——高实时、只要确定性结论的封闭任务(如邮件分流实测:300 封信 9.9 秒分流到 15 个部门仅花 $0.036,同任务 DeepSeek 同期只读了 10 封)。作者呼吁社区开发一个 Jev harness。
所属事件:高频实测 Jev:中文表现差、边界明显(2 条相关)→
「模型」频道最新
- 35 年 IT 老兵读完 OpenAI 事件报告:末日论者其实搞反了 — DavidLinthicum · 2026-09-20
- 数学家抱怨 AI 证明难懂,能否用可读性奖励模型训练出「讲人话」的证明器? — iScienceLuvr · 2026-09-20
- Sentence Transformers 逐渐霸榜 HF 下载页,编码器要复兴 — tomaarsen · 2026-09-20
- Nautilo 演示人机共创设计:生成Pelican骑车图后手动接管改层 — Dan_Jeffries1 · 2026-09-20
- 观察:模型自我批评 Trend 上升,Opus 3 对开发者负面情绪最低 — repligate · 2026-09-20
- DeepMind 高管放话 100% 重回前沿,Gemini 4 迟迟未发引猜测 — nathanbenaich · 2026-09-20