Planetary Prediction Engine: Autonomous Geospatial Prediction via Intelligent Data Selection and Foundation Model Embeddings
Evelyn Ma, Rama Kumar Pasumarthi, Kishwar Shafin, Mandar Sharma, Mimi Sun, Hamed Sadeghi, Dav M. Ebengo, Mbulayi Onesime, Rouslan Solomakhin, John Wamburu, William Ogallo, Aisha Walcott-Bryant, Sanxing Chen, Arbaaz Muslim, Yael Mayer, Ronald Ho, Roy Lee, Ruth Alcantara, Abdoulaye Diack, Monica Bharel, Lambert Rosique, Jeremy Amez-Droz, Christopher Haire, James Manyika, Yossi Matias, Niv Efron, Gautam Prasad, Shravya Shetty
cs.AI, cs.LG
2026-08-27
Google Research 的 PPE 从自然语言查询自动拉地理数据、融合 PDFM 与 AlphaEarth embedding 并搜模型。21 项 CDC 健康指标均值 R² 从 60.0% 提到 76.8%,尼日利亚粮食安全降尺度从 31.5% 翻到 66.1%。
做一张能指导救灾、公卫或粮食援助的地图,通常要几周。数据散在 Data Commons、Earth Engine、各国门户和卫星产品里,还要挑代理变量、对齐行政区、接上 PDFM 和 AlphaEarth 这类地理基础模型 embedding,再防空间泄漏、调模型。一次流行病学 nowcasting 工作流可以拆出 700 多步。现成 AutoML 和科研 agent 大多吃已经洗好的表,不会自己去行星级数据生态里找数、对齐异构 embedding、参数化传播模型。
Google Research 把这套流程做成 Planetary Prediction Engine(PPE),挂在 Google Earth AI 下。输入自然语言查询,输出训练好的地理预测模型和报告。刚果民主共和国国家生物医学研究所(INRB)合作了 2026 年 Bundibugyo 埃博拉 nowcasting。
三阶段,每段一个 LLM 编排器,temperature 固定为 0。阶段之间只传 DataFrame / GeoJSON 的不透明句柄,原始表不进 prompt,既躲开上下文窗口,也把选数和训练隔开。
任务类型在第一阶段就定:空间回归、超分辨率降尺度、空间传播、流行病学 nowcasting。模型族覆盖 Ridge / Lasso / ElasticNet、HistBoost、XGBoost、Keras MLP。过拟合守卫先看样本量 n、特征比 p/n 和空间分组:风险高就偏向强正则线性模型,树深也砍短;验证集崩了只允许重启一轮更保守的搜索。尼日利亚粮食安全只有 30 个州,再接 330 维 PDFM,p/n 会立刻失控,这套守卫是冲着这种小样本高维设定写的。
对照分四档:专家手工管线或公开 SOTA、只用协变量、只用或加上 embedding、全栈(协变量 + embedding + 智能选数)。
| 任务 | 指标 | PPE | 对照 |
| 美国 21 项 CDC 健康指标,普查区 | 均值 R² | 76.8% | 专家管线 60.0% |
| FEMA 全国风险指数 20 项 | 均值 R² | 64.9% | 专家 59.9% |
| 美国 SVI,县一级 | 均值 R² | 66.2% | PDFM 单模态 58.6% |
| 尼日利亚粮食安全,州→LGA | R²(州级 LOSO) | 66.1% | 宏观+插值 31.5% |
| 2026 刚果 Bundibugyo 埃博拉,519 卫生区 | Recall@10 | 83.3% | 贝叶斯 SOTA 73% |
CDC 这一档最能说明 embedding 单独不够用。PDFM 单独 59.7%,加上 AlphaEarth 61.8%,几乎贴着专家基线;把 Data Commons 协变量和智能选数接上才跳到 76.8%。增益来自自动找到的统计协变量。
尼日利亚 FCG 在 30 个州、40 个月上训练,在 581 个 LGA 上评。植被指数一项就把州级 R² 从 31.5% 拉到 60.1%,全栈 66.1%。LGA 真值是独立的多层回归后分层(MRP)估计,模型训练时看不见,这一档 PPE 的 MAE 是 10.0%,基线 13.6%。系统最后选的是梯度提升 + 时间宏观项 + 夜光 + 植被,再加信号反而掉点。SVI 从县降到邮编区,全栈 R² 37.6%,相对宏观插值的 11.0% 仍有大幅提升,但绝对水平说明跨行政边界的异质性还在。
埃博拉是滚动一周预报:五个评估周里 18 个新侵入卫生区,Top-10 抓住 15 个。只加地理协变量是 77.8%,全栈 83.3%,95% CI 为 [60.8, 94.2],事件数少,区间很宽。附录里空间传播回归更擅长排新热点(测试 Top-10 准确率 0.8),SEIR nowcasting 更擅长病例量(测试 RMSE 0.92,基线 6.08)。一次完整 nowcasting 跑了 793 步,三段会话合计约 55 分钟。
给不会自己拼 Earth Engine 和防泄漏验证的人一条自然语言入口。人道主义和公卫场景里,「几周才能上线一个模型」本身就是问题。PPE 可复用的是选数协议、Feature Gate 和过拟合守卫,不是某一个预测器。PDFM 目前是预上市加研究使用,AlphaEarth 公开,整机很难在 Google 外面原样复制,但「先锁任务类型、再按文献找代理、再把表和冻结 embedding 分开处理」这条可以搬。
对已经在做地理 ML 的团队,这是渐进自动化:模型族停在 Ridge 到 XGBoost 到 MLP,没有新的预测器。价值在数据发现、泄漏控制和数据和模型一起搜,而不是只调超参。
作者自己列了四条:embedding 冻结不微调;SVI 降尺度时往 PDFM 栈上加高分辨率 AlphaEarth,R² 从 52.0% 掉到 40.1%,细尺度卫星特征会变成噪声;因果方向过滤器没有形式化验证;流行病学只评了一次疫情。
另外几处读下来没有钉死。CDC 和 FEMA 空间回归跟公开 SOTA 对齐,用了普查区约 8 万条的 80:20 随机划分,空间自相关会把分数抬高;论文提供了 Spatial Group Split,主表没用。埃博拉 Recall@10 的置信区间宽到和基线几乎咬边,「+10.3 个百分点」不宜读成稳定胜出。摘要里尼日利亚「准确率翻倍」对应的是州级 LOSO 的 R²,LGA 上公开的是 MAE,两套数字不要混着引用。Feature Gate 由 LLM 按四条准则审特征,双向因果的目标很容易漏。Maps Platform Insights 走 GCP 商业计费,开源复现会缺一块。