PhenoBench 发布:90 项任务检验 LLM 临床表型预测能力

segal_eran · x · 2026-09-17

团队基于 Human Phenotype Project 构建了 PhenoBench,覆盖 15 个临床领域的 90 项任务,使用临床、影像、分子与可穿戴设备数据,检验当今 AI 模型对深度表型队列信息的利用能力。

主要发现:

作者强调,大部分工作量在于设计任务和评估模型回答质量,这一步比实际跑模型耗时更多;完成之后换模型或换测量指标的边际成本就很低了。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →