JevBench 官方榜单:Microsoft-Decision-1 居 API 决策模型第 6
airesearch12 · x · 2026-10-11
JevBench 作者回应微软视频引用基准的问题,指出微软引用的是开放模型排行榜,而非 API 提供商榜单,并给出官方结果:Microsoft-Decision-1 在 API 决策模型同组中排第 6,在招聘、风险评估、游戏、广告、科学和内容审核等场景表现强劲,也是 API 榜单前十里最强的混合语言任务模型;但总榜上 Jev 排第 4 压过它,Sage 居首。JevBench 因速度与成本差异,将 API 模型与开放权重模型分开排名。
所属事件:JevBench 作者回应微软引用争议 解释双榜分设缘由(2 条相关)→
「模型」频道最新
- 圈内人观察:模型实例大任务后会"疲惫",输出质量肉眼可见下降 — repligate · 2026-10-11
- 用户感叹: Grok 与 Astra 一年内的智能跃升被低估 — RachelVT42 · 2026-10-11
- 辟谣:阿里云仅下线旧版 Qwen 模型,并未下架 DeepSeek 等四家对手 — pstAsiatech · 2026-10-11
- 用「死鲑鱼也显脑活动」讽 LLM 可解释性过度解读 — IgorCarron · 2026-10-11
- OpenAI 守护栏杆拦死防御性代码,开发者被迫转投 GLM 5.3 — yacineMTB · 2026-10-11
- Claude 3 Opus 与 Opus 5.5 又开始满屏输出 ASCII 了 — repligate · 2026-10-11