4700 会话实测 Jev Router:成本高 38%,可操控性接近 Opus 5.5
arena · x · 2026-10-08
Agent Arena 发布对 @typesafeai 的 Jev Router 的评测,基于 4700+ 真实智能体 会话:
- 未改进 帕累托前沿:要达到与 DeepSeek V4.1 闪光(最大)相近的性能,成本高 38%,中位请求延迟是后者的 1.7 倍(6.18秒 vs 3.64秒;P90 为 30.59秒 vs 14.26秒)。
- 路由去向:28.1% 调用路由到 DeepSeek V4.1 闪光,明显偏好 OpenAI 模型——GPT-6 Astra(23.5%)、Sol(22.8%)、Luna(11.1%)。
- 若上榜:净提升 +3.6%,每任务中位成本 $0.155,排名低于 DeepSeek V4.1 闪光;但在 Steerability(+10.0% vs -0.2%)和 Praise vs Complaint(+6.3% vs +2.1%)上占优,Confirmed Success、Bash Recovery、工具 幻觉 仍落后。
- 核心亮点是可操控性:+10% 的得分仅比 Claude Opus 5.5(高)(+10.48%)低 0.48 个百分点,说明其在用户纠错反馈下能路由到更强模型。
所属事件:Agent Arena 实测 Jev Router:成本高38%、延迟翻倍,直连 DeepSeek 更划算(5 条相关)→
「编程与Agent」频道最新
- 开源替代 Cloudflare Durable Objects:Durable Actors 面向 Agent 集群发布 — ritakozlov · 2026-10-08
- AI 时代必学技术清单:Linux、Claude Code、Git、LaTeX 一样不能少 — jessi_cata · 2026-10-08
- prompting 越来越像招人:让他先用两句话证明读懂了你的项目 — seanmcdonaldxyz · 2026-10-08
- Sentry CEO:基准显示各家模型代码审查发现的核心问题高度一致 — zeeg · 2026-10-08
- Meta 等发布 Context Language Models:让模型自己管理上下文当文件改 — RulinShao · 2026-10-08
- 开发者自嘲:记不清上次手敲 git 命令是什么时候 — haydendevs · 2026-10-08