24 个小模型跑 669 道临床决策题:3GB 模型只差榜首 8.2 分
MaziyarPanahi · x · 2026-10-07
作者用 669 个临床决策场景(分诊、病历记录、临床标准、ICD-10 编码)实测 24 个可本地运行的小模型:typesafe 的 Jev 以 628 分居首,Cloudflare 的 Clef 27B(621)与 perplexity 的 pplx-decider(619)紧随其后,liquidai 的 d1 得 615。最新的 lev 模型仅 3GB,比 Clef 27B 小 18 倍,得分仍达 84.6%,只落后 8.2 分——展示本地小模型在医疗场景的可用性。
所属事件:24 个本地小模型实测 669 道临床决策题(2 条相关)→
「模型」频道最新
- Paradigm 从零训练数学模型 Limite 1B-Violetto 并发布技术报告 — tensorqt · 2026-10-07
- ChatGPT 传闻取消免费用户文字聊天上限并升级默认模型 — hey_abusiddik · 2026-10-07
- 5060 Ti 16GB 跑 Qwen3.8 Flash Next IQ1_M:55 tok/s 还能写出像样落地页 — bobaburger · 2026-10-07
- EmbeddingGemma 2 手机端离线跑多模态 RAG,文本仅占 191MB 内存 — Saboo_Shubham_ · 2026-10-07
- Paradigm 发布数学推理模型:7 项高难基准评测套件全开源 — tensorqt · 2026-10-07
- Limite 1B 借鉴 nanogpt speedrun 架构,用 NorMuon 训练 — tensorqt · 2026-10-07