2D 嵌入图不是定量证据:t-SNE/UMMAP 只能提假设

bravo_abad · x · 2026-10-05

一位 AI for Science 研究者长文提醒:在晶体结构、分子、单细胞数据等领域广泛使用 t-SNE/UMAP 生成 2D 嵌入图后,研究者常直接在图上做科学结论——距离远即不相关、有空隙即值得生成模型探索。但这类方法主要只保留局部邻域关系,压到 2D 时必然扭曲全局结构:t-SNE 中看似遥远的簇未必差异大,簇的大小密度不可靠,低 perplexity 下甚至可能呈现纯噪声;UMMAP 的全局结构很多来自初始化;图形随 perplexity、nneighbors、mindist 和随机种子而变。

作者给出的正确用法是:用 2D 图探索邻域、亚群、离群点和数据库错标,然后回到原始高维空间验证——在原空间计算近邻、跨种子检查模式、与 PCA 对比,并用成分、对称性、DFT 能量、实验等物理事实校验。核心原则:t-SNE/UMAP 用于生成假设,而非把视觉距离当科学度量。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →