只用欧洲数据预训练遥感和基础模型反而全面胜过全球均衡数据
anselm · x · 2026-09-12
一项基于 SatMAE(遥感领域标准 masked autoencoder)的控制变量研究发现:仅在单一大陆上预训练的地理空间基础模型,在所有下游任务上都胜过全球均衡采样数据预训练的模型——「多样性数据更好」这一支撑半数领域采样策略的假设可能是错的。
实验设计:
- 团队构建了 7 个预训练数据集,各含 700,000 个 Sentinel-2 样本,除来源大陆外其余全部相同
- 分别只用欧洲、非洲、亚洲等单一大陆数据,另加一个六大洲等量采样的 Global 数据集
- 在 4 个下游基准上微调评估:FMoW 场景分类、MOSAIKS 人口密度、ForTy 土地覆盖分割,以及含 6 项任务的 GEO-Bench
结果:不同来源大陆的模型之间性能差距达 10 到 21 个指标点。这一反直觉结论对遥感基础模型的数据采样策略有直接指导意义。
「研究」频道最新
- 数字果蝇:直接搬大脑电路图进电脑,行为准确率达 91% — alexcovo_eth · 2026-09-12
- 认知落差:公众怕 AI 造生物武器,实验室里它常做不好 — nlarusstone · 2026-09-12
- smolbenchmark:按你的 8GB 硬件实测选出最合适的小模型 — East-Muffin-6472 · 2026-09-12
- 克雷数学研究所宣布 Navier-Stokes 问题「似已获解」 — badumtsssst · 2026-09-12
- Decagon 实战复盘:用 GEPA 优化生产级提示词的 19 组消融实验 — kastnerkyle · 2026-09-12
- GraphED 用图结构共享跨材料规律,聚焦方程发现中不变部分 — bravo_abad · 2026-09-12