1.2 万张 X 光从零训练,21.7M 参数模型读出全身疾病风险与衰老

Self-supervised DXA representations encode multi-system disease risk, biological aging and heritability

Gil Sasson, Zachary Levine, Smadar Shilo, Sarah Kohn, Guy Lutsker, Anastasia Godneva, Adam Gabet, David Krongauz, Adina Weinberger, Yann LeCun, Randall Balestriero, Eran Segal

cs.CV, q-bio.QM

2026-08-03

在 1.2 万张无标注 DXA 扫描上从零训练的 21.7M 参数 JEPA 模型,预测新发疾病与死亡风险全面超过标量读数和 DINOv3。

这篇在解决什么

DXA(双能 X 光吸收测定)是拍得最多的影像检查之一:低剂量、便宜,骨科拿它筛骨质疏松,一次扫描同时覆盖骨密度和全身脂肪、肌肉分布。但临床真正用到的只有一小撮标量读数,骨密度、内脏脂肪面积、四肢瘦体重,扫描里绝大部分空间结构在出报告时就被扔掉。此前把深度学习用在 DXA 上基本是有监督路线,每换一个预测目标就得重新收一批临床标签;借用 DINOv2/v3 这类通用视觉大模型的冻结特征也不合适,它们为自然照片的颜色和边缘优化,特征偏局部纹理,而慢性病造成的是全身性形态改变。瓶颈在数据量:DXA 数据集以万计,离「百万级图像才配从零训基础模型」的常规门槛差几个数量级。

方法

LeDXA 的答案是域内从零训练。骨干是 ViT-Small/16(21.7M 参数、384 维输出),用 LeJEPA 框架在 11,540 张 HPP 队列(以色列 8,820 名成年人的深度表型队列)的无标注扫描上从零训练,不用任何 ImageNet 预训练。JEPA 的关键设计是在潜空间里预测目标表征、不重建像素:模型没法靠记住像素噪声交差,只能去学解剖形态。每个样本拆成骨密度、软组织两个模态流,各造 10 个增强视图,2 个全身全局视图加 8 个局部视图,局部视图优先取股骨和腰椎的 ROI,缺的用全身随机小图补齐,让全身成分和局部骨骼结构进同一个嵌入空间。训练目标是让所有视图预测全局视图投影的质心,再用 SIGReg 正则把投影分布拉向各向同性高斯以防表征坍缩。总账很轻:单张 L40S、400 epoch、约 10 小时。下游评估全部用冻结 embedding 接岭回归/逻辑回归,基线是同一批扫描的扫描仪标量读数(318/117 维)和 DINOv3 ViT-H+(约 8.6 亿参数、十亿级自然图像训练),所有模型统一加入年龄、性别、BMI 协变量。

结果

先确认没丢本职:LeDXA 恢复脂肪量、瘦体重、内脏脂肪等扫描仪读数 r = 0.964,骨密度恢复明显好于 DINOv3。

任务LeDXA对照
骨密度恢复(HPP,三个临床位点)r = 0.882DINOv3 0.789
年龄预测(HPP,MAE)3.53 年标量读数 5.12 年;DINOv3 4.27 年
髋关节骨关节病发生(UKBB,C-index)0.758标量读数 0.633
2 型糖尿病发生(UKBB,C-index)0.7530.721
骨质疏松判别(区域扫描,AUROC)0.91标量 BMD 0.95;DINOv3 0.85

外部队列上(47,400 张 UK Biobank 扫描,预训练完全没见过),LeDXA 预测年龄 MAE 2.90 年(r = 0.88)。现患疾病方面,37 个 HPP 自报病种里 12 个、28 个 UKBB ICD 病种里 9 个显著超过标量基线,输掉的各只有 1 个;8 项血液/生理指标(肌酐 r = 0.73、血红蛋白 0.68、HDL 0.57、睡眠呼吸指数 0.54)全部压过 DINOv3。

真正有分量的是前瞻预测。UKBB 中位 4.3 年随访里,20 个终点中 9 个 LeDXA 的 C-index 显著超过标量基线,髋关节骨关节病领先最大(0.758 对 0.633)。按基线风险分四档,第一年最高风险四分位捕获了 75% 的新发髋关节病例,标量基线只有 43%,随访结束时仍是 66% 对 41%。

由 embedding 算出的生物学年龄差(预测年龄对实际年龄的残差)与结局挂钩:看起来最老的 1/4 人群全因死亡风险高 45%(HR 1.45,已校正年龄性别),17 项基线疾病里几乎全部在该四分位更普遍。GWAS 显示其 20 个主成分平均 SNP 遗传力 0.143,DINOv3 只有 0.098,且命中 FTO、WNT16 等已知体型与骨密度位点,还找到 18 个只在 embedding 空间显著的基因座。

为什么重要

模型小、数据少、算力便宜(10 GPU 小时),却在专科影像上全面超过通用大模型,这条路线对整个医学 AI 都成立:模态足够专(低维、单通道、像素值就是物理密度)时,域内从零训练比移植自然图像大模型划算。应用侧的钩子也很具体:GLP-1 类减重药的核心安全关切就是瘦体重和骨密度流失,DXA 本来就是监测工具,一个能读出全身肌肉、骨骼、脂肪空间分布的通用表征,给了评估「减重是否伤肌肉伤骨」更细的尺子。生物学年龄差还能跟踪干预:HPP 里女性开始激素替代治疗后年龄差平均降 2.66 岁,提示这个指标可被改变。

局限与存疑

作者自列的:全部分析是观察性的;两个队列都有健康志愿者偏倚(HPP 入组排除了重症者,UKBB 同样),未分祖先群体验证,外推到常规临床人群要打折扣;随访中位仅 4.3 年。药物分析靠自报用药且样本极小(激素替代组 11 人、抗抑郁药组 17 人),只能算线索。疾病标签在 HPP 是自报的,骨质疏松标签与当下扫描可能脱节(部分人已用药治疗)。另有两点论文没细说:DINOv3 全程用冻结特征,虽然端到端微调的敏感性分析保持了同样排序,8.6 亿参数的模型只做线性探针仍略吃亏;遗传力优势的比较检验是 P = 0.025,证据不算硬。

术语

原文与代码

社区讨论

相关论文

全部论文解读