Grok 4.6登顶罕见病诊断榜首,DeepSeek新模型翻车
最新大模型基准测试RareBench结果显示,xAI的Grok 4.6在儿童罕见病诊断上表现惊艳,成功登顶榜首,并以约三分之一的成本击败了Anthropic的Claude Opus 5。与此同时,DeepSeek新发布的v4-pro模型表现不及预期,疑似在此次评测中翻车,引发了社区的广泛关注与热议。
2026-08-14 ~ 2026-08-14 · 2 条相关
- Grok 4.6 登顶罕见病诊断榜首,DeepSeek v4-pro 疑似翻车 — danielmckinn0n · 2026-08-14
- Grok登顶罕见病诊断榜首,DeepSeek与GLM新模型表现不及预期 — ns123abc · 2026-08-14