Grok登顶罕见病诊断榜首,DeepSeek与GLM新模型表现不及预期
ns123abc · x · 2026-08-14
最新评测显示,Grok 4.6在RareBench罕见病诊断基准测试中登顶,以约三分之一的成本击败了Anthropic的Claude Opus 5。同时,DeepSeek新发布的v4-pro-0813模型表现不及预期,甚至不如v4-flash版本,疑似API端点切换存在问题。此外,ZAI的GLM5.2也表现不佳,在编码能力上逊色于Kimi K3。
所属事件:Grok 4.6登顶罕见病诊断榜首,DeepSeek新模型翻车(2 条相关)→
「模型」频道最新
- 开源模型涨价引争议,社区批评用户未看清DSH商业价值 — teortaxesTex · 2026-08-14
- ChatGPT GitHub 连接器频发误报:正常写入遭安全拦截 — Phoxerity · 2026-08-14
- 代码泄露:Gemini CLI 添加 Claude 4.5 与 Opus 4.8 模型 — RussellZager · 2026-08-14
- 大模型价格战:DeepSeek暴涨1114%,Grok与Gemini降价厮杀 — kimmonismus · 2026-08-14
- Toast 1 搜索智能体实测:质量与速度兼得,价格仅十分之一 — xeophon · 2026-08-14
- 网友:算法权重已发布,引发热议 — RileyRalmuto · 2026-08-14