24 个模型跑 669 项临床决策:Jev 居首,两款免费模型追平

MaziyarPanahi · x · 2026-10-07

作者用 669 个真实临床决策场景评测了 24 个模型,覆盖分诊、病历记录、标准判定与 ICD-10 编码等任务。结果:Jev 以 628 分保持第一,Cloudflare 的 Clef 27B(621 分)与 Perplexity 的 pplx-decider(619 分)两款免费模型几乎追平,Liquid AI 的 d1 拿下 615 分。差距集中体现免费模型在医疗任务上已可对标付费头部模型,作者还在征集下一轮测试对象。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →