盘点医学 AI 评测基准:临床判断与安全沟通
iScienceLuvr · x · 2026-08-01
网友分享了一份医学 AI 基准测试(Benchmark)清单,涵盖多个维度的能力考察:
- 临床判断:如 SCT-Bench 测试模型随不确定证据变化修正诊断的能力;CPC-Bench 评估复杂诊断与检查选择;Sequential Diagnosis 测试模型在得出结论前能否提出正确问题并开具检查。这些能力正逐渐被 MAST 平台整合。
- 安全与沟通:如 First Do NOHARM v2 测试模型能否避免给出有害建议及发生关键遗漏。
- 此外,清单中还包含了 @SophontAI 自家的 Medmarks 测试套件。
「研究」频道最新
- 曝 OpenAI 新模型 Astra 连克 10 大数学难题 — ns123abc · 2026-08-01
- 微软首席科学家盛赞 OpenAI 数学与计算突破 — erichorvitz · 2026-08-01
- AI 智能体 6 天写两篇论文均被拒,瓶颈在判断力而非执行力 — rohanpaul_ai · 2026-08-01
- AI 擅长为数学猜想找反例?算力暴力搜索或重塑证明 — skdh · 2026-08-01
- AI模型Fable尝试为自发现的数学定律提供证明 — repligate · 2026-08-01
- 具身智能半年融资超935亿,批量制造的“全球第一”引发刷榜乱象 — 创业邦 · 2026-08-01