Mistral Large 4 临床决策评测并列第一,零严重失误

GuillaumeLample · x · 2026-10-07

Mistral Large 4(代号 Le Chonk,1T 参数、49B 激活,原生多模态)在 669 项临床决策测试中第一天就拿到 617 项正确,与 Jev、Clef、pplx-decider 并列第一。更关键的是,它是榜首中唯一零严重失误的模型——没有漏掉任何急诊,也没有把过敏史误读为已用药。在分诊子任务上拿到 238/240,为目前最佳。该模型已通过 API 开放,开源权重将于十月底发布。

所属事件:24 个模型实测 669 项临床决策任务(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →