Grok 4.6 登顶罕见病诊断榜首,DeepSeek v4-pro 疑似翻车
danielmckinn0n · x · 2026-08-14
最新大模型基准测试 RareBench 结果出炉,引发社区热议:
- xAI Grok 4.6 表现惊艳,在儿童罕见病诊断上击败了 Anthropic 的 Claude Opus 5 登顶榜首,且成本仅为后者的三分之一。
- DeepSeek v4-pro-0813 令人大跌眼镜,表现甚至不如 v4-flash。作者怀疑 DeepSeek 在发布时可能未正确切换 API 端点,导致模型表现异常。
- 智谱 GLM5.2 同样不及预期,作者指出在编程场景下,Kimi K3 的表现实质上远胜于 GLM。
「模型」频道最新
- Meta 发布 Muse Glimmer:30B 参数本地智能体模型 — ollama · 2026-08-14
- GPT-5.6 医疗版翻车:放弃看图,直接联网搜答案 — dejavucoder · 2026-08-14
- Philipp Schmid 盛赞某 AI 模型:兼具成本效益与极快速度 — _philschmid · 2026-08-14
- Anthropic 调整 Claude 分类器,误报率降低约 85% — dl_weekly · 2026-08-14
- 48小时内三大实验室连发新模型,AI迭代速度疯狂加速 — eyishazyer · 2026-08-14
- 单卡 H200 跑 NVIDIA Nemotron 3.5:9秒生成2千行代码 — NVIDIAAI · 2026-08-14