Jev 强项补充:研究生级知识问答与模型路由表现出色
multimodalart · x · 2026-09-22
multimodalart 补充了 Jev 在较难基准上的表现:该模型在知识型问题上表现出色,可达到研究生水平;在 Python 函数选择、工具调用和模型路由上尤其好。此前其提到 Jev 在国际象棋等推理游戏、高难度文档检索、音符和弦识别与细粒度情感分析上表现不佳。
所属事件:Jev「系统一」模型评测出炉:工具调用强,校准仍落后(4 条相关)→
「模型」频道最新
- ApodexAI 开源 FrontierAgent 框架,随 Apodex 1.1 同步发布 — heyshrutimishra · 2026-09-22
- 用自己 git 历史自建编码评测集:Flash Next Q2 夺冠,Claude 仅 8/12 — fintip · 2026-09-22
- 观察:Opus 3 只有在说服你时才收敛文风 — repligate · 2026-09-22
- 曝 OpenAI 新模型训练仅 24 天已解决百余个数学开放难题 — BilelKort · 2026-09-22
- Gemini 突然拒绝扫描书籍的文字提取,以版权为由拦截 — Mr_VRBeerscuit · 2026-09-22
- 小米 MiMo v2.6 发布:RL 三要素扩规模成最大亮点 — tokenbender · 2026-09-22