MedExpert 数据集发布:540 组专家标注评估医疗聊天机器人可靠性
mdredze · x · 2026-09-18
Johns Hopkins 的 Mark Dredze 团队宣布其博士后 Sonal Joshi 出站,两人所在小组的研究方向是用系统识别医疗聊天机器人回答中的错误与遗漏,已发表一篇论文,更多成果在路上。
已发表的论文是 MedExpert:一个用于评估医疗聊天机器人的专家标注数据集,发表于 PMLR 第五届 Machine Learning for Health Symposium。
- 包含 540 组问题-回答对,覆盖两个专科:青少年心理健康与产前保健
- 由临床领域专家逐条标注事实准确性与完整性等维度
- 旨在解决患者端 LLM 医疗机器人在临床场景中可靠性存疑的问题
- 同时提供了评估自动错误检测系统的框架
「研究」频道最新
- Liam Fedus 转发:AI 科学的尽头是真实实验室做实验 — LiamFedus · 2026-09-19
- PyTorch 大会将实测 Muon/Dion 优化器在真实训练栈中的坑 — PyTorch · 2026-09-19
- Cohere 深度综述 scaling laws:50篇论文多未报复现细节 — Cohere · 2026-09-19
- AI 首次生成完整功能性基因组,302 个候选噬菌体出炉 — BrianHie · 2026-09-19
- ActiveScale:模型-数据-硬件协同设计教机器人主动感知 — Haoyu_Xiong_ · 2026-09-19
- Schmidhuber:1991 年 Fast Weights 才是首个 Transformer,比 GPT 早 30 年 — SchmidhuberAI · 2026-09-19