Grok 4.6登顶罕见病诊断榜首,DeepSeek新模型翻车

最新大模型基准测试RareBench结果显示,xAI的Grok 4.6在儿童罕见病诊断上表现惊艳,成功登顶榜首,并以约三分之一的成本击败了Anthropic的Claude Opus 5。与此同时,DeepSeek新发布的v4-pro模型表现不及预期,疑似在此次评测中翻车,引发了社区的广泛关注与热议。

2026-08-14 ~ 2026-08-14 · 2 条相关