模拟榜单:Jev Router 净提升 3.6%,可操控性仅差 Opus 5.5 半个百分点
arena · x · 2026-10-08
Agent Arena 评测系列的补充帖,给出 Jev Router 若登上 Agent Arena 榜单的模拟成绩:
- 净提升 +3.6%,每任务中位成本 $0.155。
- 总排名低于其最常路由的 DeepSeek V4.1 闪光,但在 Steerability(+10.0% vs -0.2%)和 Praise vs Complaint(+6.3% vs +2.1%)上明显胜出。
- DeepSeek 在 Confirmed Success(+8.3% vs +2.2%)、Bash Recovery(+7.8% vs -0.7%)、Tool Hallucination(+0.4% vs +0.2%)上更强。
- 关键信号仍是可操控性:与 Claude Opus 5.5(高)的 +10.48% 仅差 0.48 个百分点。
所属事件:Agent Arena 实测 Jev Router:成本高38%、延迟翻倍,直连 DeepSeek 更划算(5 条相关)→
「模型」频道最新
- 质疑「小模型做评测」护城河论:大厂迟早蒸馏进自家模型 — Shahules786 · 2026-10-08
- Bengio 撰文驳「AI agent 入侵只是沙箱问题」,安全责任之争激化 — AlexTensor · 2026-10-08
- OpenAI 模型证明 Q 上希尔伯特第十问题不可判定,绕开 80 年老路 — aran_nayebi · 2026-10-08
- Anthropic 调整 $200 档后,该选 Opus 还是 Sonnet?播客拆解选型逻辑 — thursdai_pod · 2026-10-08
- AI 能证黎曼猜想却排不好周末行程?作者自嘲观点反转 — jxmnop · 2026-10-08
- OpenRouter 数据:用得最多的模型和被付费最多的模型正在分家 — Spiritual_Skirt_9312 · 2026-10-08