An AI Co-Data-Scientist for Prioritizing Candidate Biomarkers from Wearable Sensor Data
Yubin Kim, Salman Rahman, Samuel Schmidgall, Chunjong Park, A. Ali Heydari, Ahmed A. Metwally, Hong Yu, Xin Liu, Xuhai Xu, Yuzhe Yang, Hyeonhoon Lee, Hyewon Jeong, Kyungho Lim, MingYu Lu, Dongjae Lee, Theodora Pappa, Hanseul Cho, Maxwell A. Xu, Zhihan Zhang, Cynthia Breazeal, Tim Althoff, Petar Sirkovic, Ivor Rendulic, Annalisa Pawlosky, Nicolas Stroppa, Juraj Gottweis, Elahe Vedadi, Alan Karthikesalingam, Pushmeet Kohli, Mark Malhotra, Shwetak Patel, Samir Tulebaev, Hae Won Park, Vivek Natarajan, Hamid Palangi, Daniel McDuff
cs.AI
2026-04-16
CoDaS在9279人次可穿戴队列上筛出睡眠波动与步数/心率指数;加入人口学后,抑郁与胰岛素抵抗的增量R²仅0.040与0.021。
消费级手表和手环持续记录心率、步数、睡眠和手机使用,但把这些时间序列变成临床医生能审的生物标志物假设,至今仍靠人工特征工程,而且多数锁在单一病种。Google Research 联合 DeepMind、MIT 等机构给出 CoDaS(AI Co-Data-Scientist):一套带人监督的多智能体流水线,专门给可穿戴候选标志物做生成、对抗校验和排序。
真问题是高维生理数据里泄漏和假相关太容易。血糖的平方、已经在化验单上的 TG/HDL,都能刷出很高的相关。需要的是可追溯、可否决、能交给医生打分的候选清单。
推理和文献检索用 Gemini-3.1 Pro Preview,高频低延迟步骤用 Gemini-3 Flash Preview。Orchestrator 把工作拆成六段:数据画像、假设生成、统计与机器学习并行探索、对抗校验、机制与新颖性评估、报告起草。Scout 先摸清 schema 和临床终点;确定性 runner 做单变量检验和被试级 5 折交叉验证;Critic 与 Defender 辩论泄漏、构念重叠、混杂和生理不可信。
防泄漏写进代码路径:
报告数字先写入 Fact Sheet,再让写稿代理逐字抄,降低样本量与效应量被模型编造的风险。人可以在机制解释和搜索停滞时介入,但反馈阶段看不到原始标签和折级预测,避免按分数倒选特征。
三个队列共 9279 人次、9072 人:DWB 7497 人对应 PHQ-8,GLOBEM 704 个波次对应 PHQ-4,WEAR-ME 1078 人对应 HOMA-IR。
| 队列 | 主候选 | Spearman ρ | 对照基线 |
| DWB | 主睡眠时长波动 | 0.252(95% CI 0.23–0.27) | 人口学 Ridge CV R² 0.188 → 加 top-5 后 0.228,ΔR²=0.040 |
| GLOBEM | 入睡时刻波动 | 0.126 | 全筛特征 CV AUC=0.535,接近随机;Data Science Agent 为 0.523 |
| WEAR-ME | 步数/静息心率 | −0.374(95% CI −0.42 至 −0.32) | 仅可穿戴相对人口学 ΔR²=0.021;含化验全模型 R²=0.389 |
DWB 还排出夜间社交 App 使用 ρ=0.246、昼夜社交媒体比 ρ=0.222、多相睡眠比例 ρ=0.193。两个抑郁队列没有同一特征、同一量表上的直接复现,只在构念层都指向昼夜节律不稳。WEAR-ME 上 TG/HDL ρ=0.542 被当阳性对照扔掉:相关很强,化验室早就在测。关掉构念重叠后,glucosesq 一类泄漏能把 WEAR-ME 的 CV R² 抬到 0.963;完整流水线里 Critic 否决了这个通过 10/11 检验的特征。去掉 Scout 后 DWB R² 从 0.228 掉到 0.120,是消融里最大的跌幅。对抗辩论几乎不改交叉验证点估计,它改的是报道清单:DWB 最初吐出 145 个统计量,内部电池筛到 34 条 screened。
12 名医生约 25 小时审 16 个候选加 TG/HDL 对照。效度均分 3.69(5 分制),与 CoDaS 置信分层相关 ρ=0.67(p=0.005);附加临床价值和动手信心分别只有 2.37 和 2.34。流水线自己标成不稳定的「晚间来电时长」效度最低,1.75。盲评里 CoDaS 七维均分 3.74,对照 1.63–2.12;21 次评估中 18 次未拒稿,对照几乎全拒。DWB 上整条流水线墙钟约 8.3 小时,估计 API 费用 3.91 美元。
产品形态是假设生成与排序,不是诊断器。能直接拿走的是工程纪律:确定性计算和生成推理拆开、对抗辩论挡泄漏、Fact Sheet 锁数字、医生评分把「像真的」和「值得用」拆开。睡眠波动、步数/心率比都不是新生物学。CoDaS 的贡献是在万人级可穿戴数据上自动复现、分层,并公开增量很小。
跟进看流水线,别把那几个 ρ 当新的临床标志物。
分析全程探索性、未预注册;GLOBEM 的 PHQ-4 是 Scout 按覆盖率自选的。没有任何同一特征在对齐终点的独立队列上复现。效应量本身就小(ρ 约 0.15–0.25),PHQ-8 自带睡眠条目,睡眠波动可能部分是效标重叠。GLOBEM 特征缺失率 54.6%,主分析 AUC 接近随机。队列偏年轻到中年;步数和静息心率在行动受限或使用 β 阻滞剂的人群里会改含义。机制段落是检索文献后的事后叙事。基准评测把专用多智能体和单模型、通用 agent 放一起比,数字只能当系统级参考。11 项检查也到不了 FDA BEST 那种分析验证、临床验证和干预试验链条。