2D 嵌入图不是定量证据:t-SNE/UMMAP 只能提假设
bravo_abad · x · 2026-10-05
一位 AI for Science 研究者长文提醒:在晶体结构、分子、单细胞数据等领域广泛使用 t-SNE/UMAP 生成 2D 嵌入图后,研究者常直接在图上做科学结论——距离远即不相关、有空隙即值得生成模型探索。但这类方法主要只保留局部邻域关系,压到 2D 时必然扭曲全局结构:t-SNE 中看似遥远的簇未必差异大,簇的大小密度不可靠,低 perplexity 下甚至可能呈现纯噪声;UMMAP 的全局结构很多来自初始化;图形随 perplexity、nneighbors、mindist 和随机种子而变。
作者给出的正确用法是:用 2D 图探索邻域、亚群、离群点和数据库错标,然后回到原始高维空间验证——在原空间计算近邻、跨种子检查模式、与 PCA 对比,并用成分、对称性、DFT 能量、实验等物理事实校验。核心原则:t-SNE/UMAP 用于生成假设,而非把视觉距离当科学度量。
「研究」频道最新
- Pedro Lopes 谈 CHI 审稿:小样本 AC 堆里强推桌拒可能误伤 — plopesresearch · 2026-10-05
- 上海 AI Lab 提出 SCALE:用熵引导门控实现对 SFT 特征的抑制与反转 — Shanghai-AI-Laboratory · 2026-10-05
- UCVG.cpp:一对对比 prompt 即可为任意 LLM 生成控制向量的 C++ 工具 — Egor4more · 2026-10-05
- GPU 集群上能存在多少个数字心智?Synthese 论文提出新难题 — burny_tech · 2026-10-05
- 新论文提出「自适应重构」:智能的关键是重新定义问题本身 — ValerioCapraro · 2026-10-05
- 别把 Hessian 当二阶导矩阵:特征值是损失面的局部曲率 — techNmak · 2026-10-05