24 个模型跑 669 项临床决策:Jev 居首,两款免费模型追平
MaziyarPanahi · x · 2026-10-07
作者用 669 个真实临床决策场景评测了 24 个模型,覆盖分诊、病历记录、标准判定与 ICD-10 编码等任务。结果:Jev 以 628 分保持第一,Cloudflare 的 Clef 27B(621 分)与 Perplexity 的 pplx-decider(619 分)两款免费模型几乎追平,Liquid AI 的 d1 拿下 615 分。差距集中体现免费模型在医疗任务上已可对标付费头部模型,作者还在征集下一轮测试对象。
「模型」频道最新
- 网红实测:开源模型接入Agent编码器体验远逊Codex与Claude Code — MatthewBerman · 2026-10-07
- antirez 指出 DeepSeek v4.1 在 DeepSWE 上跑赢 Mistral Large 4 — antirez · 2026-10-07
- StartLux 自报:27B 模型在 38 项基准中 31 项领先 Jev AI — Dr_Singularity · 2026-10-07
- EmbeddingGemma 2 禁用 FP16:激活超动态范围,会 NaN 或静默降质 — tomaarsen · 2026-10-07
- EmbeddingGemma 2 降维实测:128d 缩 6 倍但质量明显下降 — tomaarsen · 2026-10-07
- EmbeddingGemma 2 代码检索提升 14%,多语言小幅领先一代 — tomaarsen · 2026-10-07