2026-09-02
1285张儿童手部X光由22名医生交叉读龄,不到12岁同一张片子人差标准差8.7个月;BoneXpert的MAE是4.8个月、超过1.8年的大偏差0.7%,都低于单个医生的6.5个月和3.4%。
儿科骨龄几乎还在用 1959 年的 Greulich-Pyle 图谱:对着左手腕 X 光,把骨化中心的形态跟标准片比对,读出一个「骨骼年龄」。这个数字用来判断发育提前还是落后,会进入生长激素、性早熟这类治疗决策。同一张片子不同医生会读出不同的岁数。AI 骨龄系统已经开始进工作流,可如果「人与人差多少」没量清楚,就没法判断一个模型是真的更好,还是刚好落在人类噪声里。
Stanford、耶鲁、波士顿儿童医院、辛辛那提儿童医院、Emory 等机构,加上 BoneXpert 的开发公司 Visiana,用先前一项多中心随机对照试验(NCT03530098,Eng 等 2021)留下的影像做了这次二次分析。目标有两层:把人类变异拆开,再拿两套自动方法和单名医生比。
摘要里的设计是 multi-reader, multi-case。1285 张左手腕片来自五家美国学术中心;每张由 4 名放射科医生独立按 Greulich-Pyle 读龄,22 名医生来自九家机构组成的中央池。变异拆到影像、阅片人、机构三层,用混合效应模型估计,并在校正年龄和性别后看阅片人之间还剩多少差。
两个自动方法做 interchangeability 分析,参照是三名阅片人的共识:
指标是平均绝对误差 MAE、均方根误差 RMSE,以及与参照相差超过 1.8 年的 substantial deviation 比例。混合效应的具体公式、深度学习算法是哪一家、可替换性检验的统计阈值,摘要都没写,下面不编。
人的离散度随年龄变。不到 12 岁,同一张片子阅片人之间的标准差是 8.7 个月;12 岁以上掉到 4.2 个月(P<0.001)。机构间差异看起来很大,有 8.9 个月,但校正患者年龄后只剩 0.3 个月:各中心病人年龄结构不同,不是各医院的「尺」差了将近一年。阅片人之间的残差在校正后仍是 1.2 个月。男童和低龄组变异更大;若干医生对年龄或性别有系统性偏差。
对单个医生,BoneXpert 的 MAE 是 4.8 个月,医生是 6.5 个月;那个未具名的深度学习算法是 6.3 个月,和单个医生几乎同一档。超过 1.8 年的大偏差比例:
| 来源 | 超过 1.8 年的比例 |
| BoneXpert | 0.7% |
| 深度学习算法 | 2.4% |
| 单个医生 | 3.4% |
结论写得很克制:自动方法落在人类变异范围之内,或优于该范围。这组数给后续骨龄 AI 提供了一个可以对着报的人类噪声地板。
医学影像 AI 论文常拿「平均几个专家」当金标准,再宣称模型打平或超过人类。这篇把金标准拆开:年轻孩子那张片子,专家之间就能差出大半岁。BoneXpert 的大偏差率大约是单个医生的五分之一(0.7% 对 3.4%),MAE 也低 1.7 个月。未具名的深度学习模型和单个医生几乎同一档,「AI 优于医生」不能写成所有自动方法的通例。
对要上线骨龄 AI 的团队,这篇更像一份校准表。报 MAE 时要说清对照的是单个医生还是共识,也要按年龄、性别分层。不到 12 岁的男孩是噪声最大的区间。
Springer 全文在付费墙后,分层表、Bland-Altman、哪些医生有偏、深度学习算法的身份,都看不到。利益冲突写在 Crossref 元数据里:Thodberg 是 Visiana 的 CEO,Thrane 是员工,研究经费来自 Visiana;公司提供软件和技术支持,但不接触底层影像和患者级数据,统计分析由学术侧独立完成。隔离声明在,结构仍是「被评软件的东家出钱」,读 BoneXpert 领先的幅度时要留一档。
数据可用性声明写本研究未生成或分析新数据集,因为它是既有试验的二次分析。22 名医生来自学术中心,外推到社区医院或非美国人群要小心。Greulich-Pyle 图谱对非欧洲裔儿童的适用性,这篇摘要没有讨论。深度学习算法匿名,无法判断它是否就是 2017 年 RSNA 骨龄挑战的获胜模型,或 Larson / Eng 那条产品线。