PhenoBench 发布:90 项任务检验 LLM 临床表型预测能力
segal_eran · x · 2026-09-17
团队基于 Human Phenotype Project 构建了 PhenoBench,覆盖 15 个临床领域的 90 项任务,使用临床、影像、分子与可穿戴设备数据,检验当今 AI 模型对深度表型队列信息的利用能力。
主要发现:
- 表格基础模型(tabular foundation models)整体表现最好,但相对 ridge regression 的提升有限
- LLM 呈现典型的「锯齿状前沿」:部分任务表现较好,另一些很差
- 使用相同输入字段训练的模型通常表现更好
作者强调,大部分工作量在于设计任务和评估模型回答质量,这一步比实际跑模型耗时更多;完成之后换模型或换测量指标的边际成本就很低了。
「研究」频道最新
- 世界模型通用架构解析:tokenizer 设计是各家方法的核心分歧点 — abursuc · 2026-09-17
- TMLR 遭投稿洪峰收紧 desk reject,总编找人测试被拒作者能否读懂自己的论文 — RexDouglass · 2026-09-17
- 当代世界模型的主流架构:tokenizer 压缩状态再预测下一状态 — abursuc · 2026-09-17
- 本地推理慢?推测解码用小模型起草、大模型批量验证 — HowDevelop · 2026-09-17
- 研究者提议创办「vibe-coded 论文」期刊,由 AI 负责审稿 — peter_richtarik · 2026-09-17
- 学者提出世界模型三层次框架:关联、干预、反事实缺一不可 — abursuc · 2026-09-17