2026-10-09
GPT-5.2 筛完 3967 篇引用 TRIPOD 的开放获取预测模型论文,仅 12.2% 声明共享分析代码。380 个可检查仓库里,写明依赖的占 37.6%,带测试的只有 3.9%。
临床预测模型要被人拿去校准、做外部验证,再谈进不进临床,分析代码得能被第三者看懂并重跑。预处理、拟合、调参和评估都写在代码里,正文经常写不全。TRIPOD 和 2024 年更新的 TRIPOD+AI 把报告条目补齐了。TRIPOD+AI 的第 18f 条鼓励公开分析代码,但没有规定仓库里要有什么:README 写不写目的,依赖锁不锁版本,随机种子固定没有。
更早的测量都比较窄。PubMed Central 里的 Python notebook,只有 5.3% 能从头跑通。医学影像深度学习会议 MIDL 的接收论文里,22% 的公开仓库被判为可重复。160 篇深度学习计算病理论文中,大约四分之一公开了代码。这些数字已经说明声明有代码和别人能用差得很远,但它们覆盖不了「已经在引用报告规范」的临床预测模型文献。这篇是 TRIPOD-Code 扩展的第一阶段,把这个群体的共享率和仓库质量量出来,给后面的 Delphi 共识做底数。
队列截到 2025 年 8 月 11 日。PubMed 上引用 TRIPOD 的有 6762 篇,引用 TRIPOD+AI 的有 411 篇,去重后 6658 篇。为了避开订阅墙,只保留能从 PMC 开放获取接口拿到全文的文章,1407 篇因此出局。GPT-5.2(版本 2025-12-11)按冻结的结构化输出判断剩下的是不是多变量预测模型:至少两个预测因子,用来估计某人当前患病的概率,或未来发生某结局的概率。1284 篇被判为不符合,留下 3967 篇。
同一个模型抽出代码可用性声明、仓库链接,以及第一作者机构所在国家。两位审稿人独立标注了随机抽出的 500 篇。对照人工标签,加权 F1 为 0.97,仓库链接提取准确率 92.3%。
仓库抓取支持 GitHub、GitLab、Gitee、Zenodo、Figshare、OSF,以及能解析到这些平台的 DOI,取默认分支。工具先给出完整文件树,再放入 README 和代码。大二进制文件丢掉,其余文件截到 3000 token。模型按事先定好的 14 项特征打标:README 及其是否写清目的和预期输出、模块化、依赖及版本约束、许可证、论文链接、引用信息、测试、硬件需求、数据或样例、随机成分是否固定种子。后三项只在前提成立时才评。
35 个仓库由同样两位审稿人按同一标准标完。加权 F1 为 0.83。README、LICENSE、测试三项的 F1 都是 1.0,「文档是否充分」降到 0.71。
「共享了代码」的口径故意放宽,以免低估。附录里给了代码的 75 篇算共享,链接指向抓取工具不支持的平台也算。能下载、且至少有一个非空源码文件的,才进入后面 380 个仓库的质量评估。私人仓库、坏链接和用户主页不进这 380 个。
3967 篇里 482 篇有代码共享声明,占 12.2%。发表年份每增加一年,共享的优势比 OR 为 1.12(95% CI 1.07-1.18)。比例从 2015 年的 6.3%(1/16)、2016 年的 4.5%(2/44),升到 2024 年的 14.5%(119/820)和 2025 年的 15.8%(74/468)。
只引用 TRIPOD+AI 的共享率是 29.2%,只引用 TRIPOD 的是 11.4%,OR 3.20(95% CI 2.23-4.59)。把发表年份放进回归后,adjusted OR 仍为 2.61(95% CI 1.79-3.82)。2025 年单年是 29.7%(30/101)对 11.8%(42/356)。清单里写上代码条目之后行为确实不同,29% 离默认公开还远。
发文量上中国占 32.4%,美国 11.6%,英国 9.1%。共享率在国家之间差得很开(Pearson χ²(26) = 134.59)。最高的是芬兰 33.3%、比利时 26.7%、以色列 23.1%。图中只纳入超过 10 篇的国家,正文没有给出这三国的精确分母。期刊差异同样显著。超过 10 篇的 71 本期刊里,17 本共享率是 0。最高的四本都写了代码政策:Nature Communications 71.4%(14 篇),npj Digital Medicine 57.1%(28 篇),PLOS Digital Health 和 PLOS Medicine 都是 52.6%(各 19 篇)。npj Digital Medicine 的投稿说明写明,重要代码不提供时编辑可以拒稿。
声明几乎无法模板化。94.4% 的措辞只出现过一次。出现位置最多的是数据可用性 232 处、方法 211 处、补充材料 84 处,一篇可以有多处。68.6% 的文章只有一处声明。
447 个仓库链接里,27 个平台不支持,38 个打不开,2 个打开了但没有源码。剩下 380 个里,83.4% 在 GitHub,OSF 3.6%,Zenodo 3.4%,GitLab 1.6%。
| 仓库特征 | 在 380 个仓库中的比例 |
| 有 README | 80.5%,其中写清目的和预期输出的占全部仓库 52.1% |
| 模块化、结构清楚 | 42.4% |
| 写明软件依赖 | 37.6%,锁了版本的占全部仓库 21.6% |
| 带数据或样例 | 37.1% |
| 链回论文 | 36.8% |
| 有许可证 | 35.3% |
| 有正式引用信息 | 19.5% |
| 写了硬件需求 | 8.4% |
| 有测试 | 3.9% |
| 含随机成分者固定了种子 | 286 个里的 64.3% |
Python 出现在 190 个仓库,R 在 189 个,两者可以同时出现。Python 的年度优势比是 1.31(95% CI 1.16-1.49),R 是 0.85(95% CI 0.75-0.96),两个 P 值做了 FDR 校正。2023 年 Python 超过 R,2025 年占到语言出现次数的一半以上。
没有一本期刊在各项上同时最好或最差。各项平均之后,PLOS Digital Health 比全局平均高 11.9%,垫底的期刊有七项是 0。共享率高,仓库质量不一定跟着高。
TRIPOD-Code 下一步要用 Delphi 决定哪些要素算必须、哪些算推荐、哪些看场景。这篇交出的是现在的底数。做临床预测模型的人可以把 12.2% 当参照:引用了报告规范、又发在开放获取上的研究,大约八篇才有一篇公开代码。公开了的里面,有许可证的 35.3%,锁了依赖版本的 21.6%,有测试的 3.9%。没有许可证的代码处在法律不确定状态,链接公开不等于可以拿去复用。
期刊政策拉得动共享率,拉不动仓库质量。共享率最高的几本都给了明确指引,同一出版商的统一政策下,不同期刊仍然差得很远。文中的判断很具体:只要求把代码交上去,并不足以让计算可复现。让审稿人逐个仓库检查可复现性,以现在的审稿负担不现实,自动评估被留成开放问题。
逐篇标注和审查代码在 thomas-sounack/TRIPOD-Code,归档号 10.5281/zenodo.22102059。
作者写了两条。LLM 会分错,点估计应当成趋势,不要当成精确到个位的普查。队列只包括引用了 TRIPOD 或 TRIPOD+AI、并且能从 PMC 开放获取拿到全文的研究。这批工作本来就更在意报告规范,共享率相对整个预测模型文献可能偏高。外推不到 STARD、CLAIM 那些清单。
还要再打几个折。仓库特征的人工对照只有 35 个,主观项 F1 为 0.71,「模块化」「文档充分」的百分比不宜读成精确普查。12.2% 的分子里含有附录代码和未核验的外部平台链接,可访问性被放宽了一截。1407 篇非开放获取整段剔除,付费期刊的习惯未知。国家按第一作者机构计,没有把合作网络和期刊分布拆开。
利益冲突已经披露,读期刊排名时要算进去。Gary Collins 与 Karel Moons 是 TRIPOD 和 TRIPOD+AI 的主要制定者。Leo Anthony Celi 是 PLOS Digital Health 的主编,Tom Pollard 也在其编委里。Hyeonhoon Lee 是 npj Digital Medicine 的副编辑。这几本恰好都在共享率的高位。
最硬的缺口是仓库没有被真正跑一遍。有测试的 3.9%,离「能复现论文里的数字」还有一段。他们引用的 notebook 重跑研究里,能从头跑通的只有 5.3%。