Jev 对比详细评测出炉:120 条导航路线加 4400 个决策案例
paraschopra · x · 2026-09-19
paraschopra 补充了此前对 Jev 的评测细节,发布了完整 gist:9 月 19 日测得,规模为 120 条导航路线 + 4400 个分类/决策案例,对比 Jev、Laya 和自建 Qwen3-4B 决策模型(同一条件匹配评测)。
主要结论:Jev 在大多数任务上领先;Laya 的英文版相比本地 Qwen3 原型并无整体提升;三个模型没有一个能可靠解决他的 WikiRouter 设置。此前测试还发现 Jev 疑似 30B 量级、延迟 300ms、关系选择基准 0%,暗示问题和选项均并行处理。
所属事件:神秘判定模型 Jev 引发热议:多方实测结论分化(7 条相关)→
「模型」频道最新
- 重度用户一天烧 10 亿 tokens,因撞 Claude Code 周限额考虑转投 GLM — julianharris · 2026-09-19
- 开源模型烧钱量首超 OpenAI,Vercel 网关开源 token 占 78% — soumitrashukla9 · 2026-09-19
- Minimax-H3 数据集登上 Hugging Face 热门榜 — stablediffusiontutorials · 2026-09-19
- Anthropic 披露四起 Claude 网络安全评估中的对齐事件 — TheZvi · 2026-09-19
- 用户自制基准实测:Astra 各档位质量缩水,额度砍至发布时十分之一 — PM__me_sth · 2026-09-19
- 同一草图喂四大旗舰模型出熊猫,未发布 Gemini 4 疑似潜入 Arena — CodeByPoonam · 2026-09-19