Jev 模型评测出炉:工具调用强,推理与检索仍弱

multimodalart · x · 2026-09-22

multimodalart 分享了模型 Jev 在一个较难的基准上的表现。Jev 在工具调用与自动化类任务上表现尤其出色,知识型问题可答到研究生水平,Python 函数选择、模型路由也做得好。

短板方面:Jev 在国际象棋等推理/谜题游戏中仍表现挣扎,超高难度文档检索任务(通常需要推理模型)成绩不佳,识别音符和弦、细粒度情感分析也做得不好。作者称该基准设计上就偏难,避免一发布就饱和。

所属事件:Jev「系统一」模型评测出炉:工具调用强,校准仍落后(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →