Mistral Large 4 临床决策评测并列第一,零严重失误
GuillaumeLample · x · 2026-10-07
Mistral Large 4(代号 Le Chonk,1T 参数、49B 激活,原生多模态)在 669 项临床决策测试中第一天就拿到 617 项正确,与 Jev、Clef、pplx-decider 并列第一。更关键的是,它是榜首中唯一零严重失误的模型——没有漏掉任何急诊,也没有把过敏史误读为已用药。在分诊子任务上拿到 238/240,为目前最佳。该模型已通过 API 开放,开源权重将于十月底发布。
所属事件:24 个模型实测 669 项临床决策任务(3 条相关)→
「模型」频道最新
- OpenAI 数学成果惊现千禧年大奖题:希尔伯特第十问题有理数版被解决 — almmaasoglu · 2026-10-07
- Gwern 旧论断被重提:采样只能揭示知识的在场,无法证明缺席 — akbirthko · 2026-10-07
- Grok 4.7 上线 Microsoft Foundry,xAI 模型扩大企业分发 — SpaceXAI · 2026-10-07
- Claude 用 3D 动画讲解 Hodge 猜想新证明:百万美元难题家族被解 — imjustnewatai · 2026-10-07
- Claude Opus 5.5登顶AA指数达58,但单位任务成本与上代持平 — qinzytech · 2026-10-07
- 实测金融分析:小模型排名一致性仅 15%,前沿模型达 75% — Rough_Practice7631 · 2026-10-07