Grok登顶罕见病诊断榜首,DeepSeek与GLM新模型表现不及预期

ns123abc · x · 2026-08-14

最新评测显示,Grok 4.6在RareBench罕见病诊断基准测试中登顶,以约三分之一的成本击败了Anthropic的Claude Opus 5。同时,DeepSeek新发布的v4-pro-0813模型表现不及预期,甚至不如v4-flash版本,疑似API端点切换存在问题。此外,ZAI的GLM5.2也表现不佳,在编码能力上逊色于Kimi K3。

所属事件:Grok 4.6登顶罕见病诊断榜首,DeepSeek新模型翻车(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →