24 个本地小模型实测 669 道临床决策题
有开发者用 669 个真实临床决策场景对 24 个可本地运行的小模型进行评测,任务覆盖分诊、病历记录、临床标准判定与 ICD-10 编码。结果显示 typesafe 的 Jev 以 628 分位居榜首,Cloudflare 等两款免费模型表现追平领先水平,体积仅 3GB 的模型与榜首差距仅 8.2 分,显示小模型在医疗场景已具备可观实用性。
2026-10-07 ~ 2026-10-07 · 2 条相关
- 24 个模型跑 669 项临床决策:Jev 居首,两款免费模型追平 — MaziyarPanahi · 2026-10-07
- 24 个小模型跑 669 道临床决策题:3GB 模型只差榜首 8.2 分 — MaziyarPanahi · 2026-10-07