Jev 模型评测出炉:工具调用强,推理与检索仍弱
multimodalart · x · 2026-09-22
multimodalart 分享了模型 Jev 在一个较难的基准上的表现。Jev 在工具调用与自动化类任务上表现尤其出色,知识型问题可答到研究生水平,Python 函数选择、模型路由也做得好。
短板方面:Jev 在国际象棋等推理/谜题游戏中仍表现挣扎,超高难度文档检索任务(通常需要推理模型)成绩不佳,识别音符和弦、细粒度情感分析也做得不好。作者称该基准设计上就偏难,避免一发布就饱和。
所属事件:Jev「系统一」模型评测出炉:工具调用强,校准仍落后(4 条相关)→
「模型」频道最新
- ApodexAI 开源 FrontierAgent 框架,随 Apodex 1.1 同步发布 — heyshrutimishra · 2026-09-22
- 用自己 git 历史自建编码评测集:Flash Next Q2 夺冠,Claude 仅 8/12 — fintip · 2026-09-22
- 观察:Opus 3 只有在说服你时才收敛文风 — repligate · 2026-09-22
- 曝 OpenAI 新模型训练仅 24 天已解决百余个数学开放难题 — BilelKort · 2026-09-22
- Gemini 突然拒绝扫描书籍的文字提取,以版权为由拦截 — Mr_VRBeerscuit · 2026-09-22
- 小米 MiMo v2.6 发布:RL 三要素扩规模成最大亮点 — tokenbender · 2026-09-22