临床决策基准更新:pplx-decider 95.2% 登顶,与 Jev 并列第一
MaziyarPanahi · x · 2026-10-07
MaziyarPanahi 更新了他的临床决策基准测试结果:用 669 个临床决策案例评测 24 个 Jev 风格模型,涵盖分诊、病历记录、临床标准、ICD-10 编码等任务。
- 新的 pplx-decider(Perplexity)得 637/669(95.2%),成为最高分,与 Jev 并列第一
- 此前 Jev(@typesafeai)以 628 分居首,两个免费模型追平了它
- 第二梯队:Clef 27B(Cloudflare)621、d1(Liquid AI)615
- 作者征集下一个要评测的模型
所属事件:669 项临床决策实测 24 个小模型,pplx-decider 95.2% 登顶(6 条相关)→
「模型」频道最新
- Reddit 用户两周内两次发现新 Gemini Flash 界面选项 — alovoids · 2026-10-07
- LLM 缺乏「幂等性」:复查自己的大代码库会自相矛盾 — StephanSturges · 2026-10-07
- Liquid AI 宣布今天发布新款 LFM 模型 — jacek2023 · 2026-10-07
- 网友讨论 Gemini 4 Argon 蒸馏到 Pro/Flash 的前景 — GarnetExecutioner · 2026-10-07
- 网友让 GPT-6 Pro 排序三年发现:81% 竟在今天集中发布 — basedjensen · 2026-10-07
- TII 发布 Falcon-Emirati-7B:靠 3 类数据让大模型学会方言 — lmoroney · 2026-10-07